AI Frontier Daily / 2026.06.03

OpenAI 把 Codex 扩展成多角色工作平台

OpenAI 宣布 Codex 新增角色插件、Sites 和 annotations。角色插件覆盖数据分析、销售、创意制作、产品设计、公开股票投资和投行业务,官方称合计包含 62 个常用应用和 110 个 skills。Sites 面向 Business 与 Enterprise 预览,可把想法、分析和计划生成可分享的交互式网站或轻量应用;annotations 则把“点选后局部修改”的工作流扩展到文档、表格、幻灯片和站点。OpenAI 同时称 Codex 每周用户已超过 500 万,非开发者约占 20%,且增长速度高于开发者。

1/15 OpenAI 把 Codex 扩展成多角色工作平台

OpenAI 宣布 Codex 新增角色插件、Sites 和 annotations。角色插件覆盖数据分析、销售、创意制作、产品设计、公开股票投资和投行业务,官方称合计包含 62 个常用应用和 110 个 skills。Sites 面向 Business 与 Enterprise 预览,可把想法、分析和计划生成可分享的交互式网站或轻量应用;annotations 则把“点选后局部修改”的工作流扩展到文档、表格、幻灯片和站点。OpenAI 同时称 Codex 每周用户已超过 500 万,非开发者约占 20%,且增长速度高于开发者。

来源@OpenAI123

2/15 Microsoft AI 发布七个 MAI 模型和 Frontier Tuning

Microsoft AI 在 Build 期间发布七个自研 MAI 模型,覆盖推理、代码、图像、转录和语音。旗舰 MAI-Thinking-1 被描述为 35B active、约 1T total 参数的 MoE,拥有 256K 上下文窗口,并以干净授权数据从零训练。微软称该模型在 AIME 2025 达到 97%,在 SWE-Bench Pro 上接近 Claude Opus 4.6,并在盲测中优于 Sonnet 4.6。同步推出的 Frontier Tuning 让企业用自身工作流轨迹训练专属模型,微软称 Excel 和 McKinsey 场景已有约 10 倍效率收益。

来源@mustafasuleyman@satyanadella12

3/15 Mayo Clinic 与 Microsoft 共建医疗 frontier AI 模型

Microsoft 与 Mayo Clinic 宣布合作开发面向医疗的 frontier AI 模型。双方称模型将结合 Mayo 的临床专业知识、去标识化临床健康数据和纵向洞察,以及 Microsoft 的 AI、云和工程能力,用于临床推理、早期诊断、个性化治疗决策和护理团队支持。模型所有权归 Mayo Clinic,并将先在 Mayo 的受信临床环境内测试、验证和改进;验证后,Microsoft 计划通过 Azure Foundry API 向其他机构开放相关能力。

4/15 Anthropic 扩大 Project Glasswing,新增约 150 家机构

Anthropic 宣布扩大 Project Glasswing,把 Claude Mythos Preview 的访问范围扩展到 15 个以上国家的约 150 家新增组织。项目最初约 50 个伙伴已用 Mythos Preview 扫描代码库,Anthropic 称已发现超过 1 万个高危或严重安全漏洞。新增伙伴覆盖电力、水务、医疗、通信、硬件和关键供应商,许多维护被政府和企业依赖的代码库。Anthropic 同时回应美国 AI 相关行政令,称该政策有助于强化美国 AI 领导力和可信防御者的网络能力。

来源@AnthropicAI12@sama

5/15 Google DeepMind 推出 Gemini 驱动的 Co-Scientist

Google DeepMind 介绍 Co-Scientist,这是一个基于 Gemini 的多智能体科研系统,用于生成、辩论、筛选和演化科学假设。系统由生成、邻近映射、反思、排序、演化和 meta-review 等专门智能体组成,通过“ideas tournament”对候选假设做交叉验证和排序,并结合文献、数据、Web 搜索及 ChEMBL、UniProt、AlphaFold 等工具。DeepMind 称该系统已在肝纤维化、ALS、细胞衰老、代谢性肝病和人畜共患病机制研究中辅助产生可测试方向,并将通过 Gemini for Science 向研究人员开放。

来源@GoogleDeepMind123

6/15 Perplexity Computer 引入本地与云端混合推理

Perplexity 宣布 hybrid agentic inference 即将进入 Perplexity Computer。该机制可把任务拆分给本机模型和云端 frontier 模型:涉及私密数据的步骤留在设备本地,复杂推理或需要更强能力的部分交给云端模型,从而在隐私、token 效率和能力之间动态取舍。Perplexity 还宣布 Health 产品支持两类新数据入口:iPhone 上的 Apple Health 连接,以及用于 labs、biomarkers、blood draws 和 panel results 的 Function 集成。

来源@perplexity_ai123

7/15 NVIDIA 推进本地 agent 和自进化 Hermes agent

NVIDIA 发布 DGX Spark 与 NemoClaw 的本地 agent 路径,并展示 Hermes Agent 与 NemoClaw 组合的自进化研究 agent。DGX Spark 更新把从开箱到本地 agent 的流程压缩为更少步骤,NemoClaw 则把开放模型、agent harness 和 OpenShell 安全运行时打包在一起,用于长上下文、长时间运行和多子 agent 任务。Hermes 示例把 Slack、Outlook、GitHub 和 NVIDIA 论坛接入同一 agent,让它从聊天纠正中学习报告格式、写入记忆和 skills,并跨部署保留状态。

来源@NVIDIAAI123

8/15 Windsurf 更名 Devin Desktop,主打多 agent 命令中心

Cognition 宣布 Windsurf 成为 Devin Desktop,把原 IDE 扩展为面向本地和云端 agent 的 Agent Command Center。产品提供 Kanban 式 agent 管理视图和 Spaces,用于共享会话、PR、文件和上下文。Devin Desktop 支持 Agent Client Protocol,首批可运行 Codex、Claude Agent、OpenCode 以及团队自建的 ACP-compatible agent。Windsurf 方面称 Codex CLI 和 Claude Agent 都可在 Devin Desktop 内运行,用户可在同一界面分配、监控、切换和审查多个 agent 的工作。

来源@windsurf1234

9/15 Cursor 总结云端 coding agent 的基础设施经验

Cursor 发布云端 agent 技术复盘,称高质量 cloud agent 的关键不是把本地 agent 搬到服务器,而是重建完整开发环境、持久执行和状态分离。文章指出云端 agent 需要依赖、网络、密钥、凭证和企业访问控制,否则质量下降常被误判为模型问题。Cursor 称其从 work-stealing 架构迁移到 Temporal 后,agent loop 可承受推理故障、pod hibernation 和数天到数周的长任务;Temporal 每天处理 5000 万次以上 action,Cursor monorepo 超过 40% PR 已来自 cloud agent。

10/15 Runway Aleph 2.0 开放 API,支持 1080p 多镜头视频编辑

Runway 宣布 Aleph 2.0 已通过 Runway API 提供,可把精细视频编辑能力嵌入应用、产品和平台。官方称 Aleph 2.0 支持最多 30 秒、1080p、多镜头序列的视频编辑,并可只改变用户指定的内容。该更新把 Runway 的生成式视频编辑能力从创作者界面推进到开发者集成层,适合被视频工具、广告生产、内容管理和自动化后期流程调用。

来源@runwayml12

11/15 Replit 接入 Microsoft Fabric,并更新 Canvas

Replit 宣布与 Microsoft 合作,企业可在 Replit 中构建内部工具、工作流和数据仪表板,并直接发布到 Microsoft Fabric,内置安全、认证和治理能力。Replit 表示这为使用 Azure 和 Fabric 的组织提供了从受治理数据到内部软件的更短路径,可在 Fabric 数据上构建应用,沿用企业访问控制,并避免自行维护基础设施。Replit 还发布 Canvas 更新,包括更好的移动体验、多编辑 visual editor、GPT-Image 2 图像生成、Seedance 视频和动画 SVG 支持。

来源@Replit123

12/15 Together 发布 MiniMax M3 生产化推理深挖

Together 发布 MiniMax M3 服务化技术深挖,聚焦 1M 上下文、多模态输入和 MiniMax Sparse Attention 在生产流量中的性能问题。Together 称其 Inference 和 Kernel 团队通过 KV-block-major sparse attention、paged MSA decode、index scoring 优化和多模态预处理,在常见 agentic-shape 流量上把吞吐提升 81% 到 125%。这条线索显示,长上下文模型的竞争正在从“能否支持 1M context”转向“能否让 1M context 在真实 agent 负载下可用且经济”。

来源@togethercompute12

13/15 Databricks 继续强调 serverless Spark 与 Liquid Clustering

Databricks 发布 serverless Spark 架构文章,称真正 serverless compute 需要把应用与计算解耦、智能路由工作负载并动态伸缩资源,而不只是 warm pool 或基础 autoscaling。文章列出 Spark Connect、Serverless Gateway 和 adaptive autoscaler 三个核心系统,并称 Spark Connect 支持超过 25 次年度 Spark runtime 升级,在 45 亿多个 workloads 上达到 99.998% 成功率。另一篇文章继续推广 Liquid Clustering,强调比传统 partitioning 更适合现代 lakehouse 读写和数据新鲜度需求。

来源@databricks12

14/15 LangChain 与 Harvey 聚焦低成本 verifier 和 agent rubrics

LangChain 相关账号和 Harrison Chase 转发、评论了 legal agent verifier 与 Deep Agents rubrics 的新工作。核心方向是让 agent 在执行复杂知识工作时,不只依赖人工验收,而是用 rubric、grader subagent 和 correction loop 检查任务是否完成。Harvey/LangChain 方向的一个重点是降低 verifier 成本,因为法律等长周期任务需要大量校验;Harrison Chase 将其归纳为扩展 evals 和 RL 的关键基础设施。Deep Agents 新增 Agent Rubrics 后,可在调用中附加评分标准,由 agent 自评并迭代。

来源@hwchase17123

15/15 新研究把 tokenization 和 retrieval 重新定义为 agent 基础设施

AlphaSignalAI 跟踪了两类底层研究。Compute Optimal Tokenization 训练 988 个 50M 到 7B 参数模型,提出 compute-optimal 配置中参数数量与按 bytes 计量的数据规模成比例,而非传统 token 数,并指出最优压缩率会随 compute 变化。Direct Corpus Interaction 则认为传统 top-k 检索接口限制 agentic search,提出让 agent 直接用 grep、文件读取、shell 和轻脚本与语料交互,在多个 IR 和多跳问答任务上优于稀疏、稠密和 reranking baseline。这些结果都指向一个趋势:agent 能力提升后,数据接口本身会成为瓶颈。

来源@AlphaSignalAI123

Deep Dive 附录

OpenAI Codex for every role, tool, and workflow

OpenAI 将 Codex 从软件开发工具扩展为面向知识工作的协作平台。官方披露 Codex 每周用户超过 500 万,非开发者约占 20%,且增速更快。新角色插件把 app connectors、skills、instructions 和 workflows 打包,覆盖数据分析、创意制作、销售、产品设计、公开股票投资和投行业务;首批合计 62 个 app 与 110 个 skills。Sites 面向 Business 和 Enterprise 预览,可把分析、计划和想法生成可分享的交互式网站或 app。Annotations 让用户对文档、表格、幻灯片和站点进行局部点选修改。 查看原文

Microsoft MAI models and Frontier Tuning

Microsoft AI 发布七个 MAI 模型,并把它们放在“hill-climbing machine”的长期自研框架中。MAI-Thinking-1 是 35B active、约 1T total 参数 MoE,支持 256K 上下文和 function calling,并以 clean、commercially licensed data 从零训练。Microsoft 宣称其在 AIME 2025 达到 97.0%、AIME 2026 达到 94.5%,在 SWE-Bench Pro 接近 Claude Opus 4.6,并在 Surge 盲测中优于 Sonnet 4.6。Frontier Tuning 使用企业真实工作流轨迹作为 reinforcement-learning environment,让企业把 MAI 模型调到自身流程上,同时保留数据和模型控制权。 查看原文

Google DeepMind Co-Scientist

Co-Scientist 是 Google DeepMind 发布在 Nature 的 Gemini 多智能体科研系统。它把科学假设生成拆成生成、邻近映射、反思、排序、演化和 meta-review 等智能体,并通过 supervisor agent 并行协调。核心机制是“tournament of ideas”:系统生成大量研究方向,用科学辩论、文献校验和数据交叉检查筛选可测试假设。DeepMind 称 Co-Scientist 已辅助肝纤维化、ALS、细胞衰老、代谢性肝病和感染病机制等研究,并在部分案例中提出经实验支持的新方向。系统还做了 CBRN misuse 评估和 unsafe-goal 分类器。 查看原文

Anthropic Project Glasswing expansion

Project Glasswing 是 Anthropic 面向关键软件防御的协作项目。Anthropic 称初始约 50 个伙伴已用 Claude Mythos Preview 扫描代码库,并发现超过 1 万个高危或严重漏洞。此次扩展新增约 150 家组织,覆盖 15 个以上国家和电力、水务、医疗、通信、硬件及关键供应商等行业。Anthropic 认为 6 到 12 个月内,多家公司可能具备 Mythos-class cyber capabilities,且不一定有同等防滥用约束,因此防御方需要提前适应更便宜、更快、更不可预测的 AI 辅助攻击环境。 查看原文

NVIDIA NemoClaw, DGX Spark and Hermes Agent

NVIDIA 的两篇技术文章共同描绘了本地、可控、自学习 agent stack。DGX Spark 更新降低本地 agent 启动门槛;NemoClaw 把开放模型、OpenClaw 或 Hermes Agent harness,以及 OpenShell 安全运行时组合成一个安装路径。OpenShell 负责 sandbox、access control、privacy protection 和 operational guardrails。Hermes 示例展示 agent 如何连接 Slack、Outlook、GitHub 和论坛,合成研究信息,从聊天纠正中学习格式和偏好,并把记忆与 skills 持久化到后续部署中。 查看原文

Cursor cloud agent infrastructure lessons

Cursor 的复盘把 cloud agent 定义为一个需要完整基础设施的系统,而不是本地 agent 的远程版本。文章指出,云端 agent 的输出质量高度依赖完整开发环境;缺少依赖、网络、密钥或凭证时,表现常常是隐性质量下降。Cursor 从早期 work-stealing 架构迁移到 Temporal,以支持推理故障、pod hibernation 和跨天/跨周任务。当前架构把 agent loop、machine state 和 conversation state 解耦,并逐步把硬编码 harness 逻辑转移给 agent 可调用的工具。 查看原文

Devin Desktop and Agent Client Protocol

Cognition 将 Windsurf 升级为 Devin Desktop,重点是把 IDE 变成多 agent 管理界面。Agent Command Center 提供 Kanban 式工作视图,Spaces 则把 sessions、PR、files 和 context 组织在一起。由于支持 Agent Client Protocol,Codex、Claude Agent、OpenCode 和企业自建 ACP agent 可在同一个编辑器中运行,第三方 agent 与 Devin 使用相同管理、上下文共享和审查流程。这个方向把“agent IDE”从单一 coding assistant 推向多 agent orchestration surface。 查看原文

Tokenization and retrieval as agent infrastructure

Compute Optimal Tokenization 表明 scaling laws 中的关键数据单位可能应按 bytes 而非 tokens 计量;作者训练 988 个 50M 到 7B 参数模型,发现 optimal compression rate 不同于常见 BPE 设置,并随 compute 增加而下降。Direct Corpus Interaction 则把检索问题改写为接口问题:当 agent 足够强时,固定 top-k semantic retrieval 可能过早丢掉证据;直接用 grep、文件读取、shell 和脚本访问 raw corpus,在多项 IR 和 agentic search 任务中优于传统 sparse/dense/rerank 管线。 查看原文