1/16 ARC-AGI-3 发布:全球唯一未被攻克的 Agentic AI 基准
François Chollet 宣布 ARC-AGI-3 正式发布,这是首个测试 AI 代理交互式推理能力的基准测试,也是目前世界上唯一未饱和的 Agentic 智能基准。与前两代侧重静态推理不同,ARC-AGI-3 要求 AI 在没有任何指令和目标的情况下,通过探索陌生环境自主学习规则。人类得分 100%,而所有前沿 AI 模型得分均低于 1%。包含 1000+ 关卡、150+ 环境,评分指标为”动作效率”——衡量 AI 与人类相比,多快能将环境信息转化为有效策略。ARC Prize 为此专门组建了一个游戏工作室来开发这套测试系统。
2/16 AI Scientist 研究成果登上 Nature 杂志
Sakana AI 与不列颠哥伦比亚大学、Vector Institute 和牛津大学合作的 The AI Scientist 论文正式发表于 Nature。这是首个能够自主执行完整 ML 研究生命周期的 AI 系统——包括生成研究想法、文献综述、设计并运行实验、撰写 LaTeX 格式论文。此前 AI Scientist-v2 曾向 ICLR 2025 研讨会提交全 AI 生成的论文,平均评分 6.33 分,超过 55% 的人类投稿。该系统内置的自动审稿人在论文质量评估上达到 69% 的均衡准确率。研究人员还发现关键规律:随着基础模型能力提升,论文质量将同步提高。
3/16 OpenAI 关闭 Sora 独立 App,迪士尼 10 亿美元投资计划随之搁浅
OpenAI 宣布关闭 Sora 视频生成应用,该 App 于 2025 年 9 月发布后曾短暂登顶 iPhone App Store,但此后下载量从峰值下滑近 75%。OpenAI 表示,Sora 团队将重新聚焦于世界模拟研究,推进机器人领域的应用。关闭决定同时波及正在洽谈中的迪士尼合作——后者原计划向 OpenAI 投资 10 亿美元,且关闭消息传出时双方团队还在开会讨论相关项目。Gary Marcus 和 Bindu Reddy 等 AI 观察者认为此举说明 OpenAI 应专注于 GPT-6 和轻量级模型两条核心路线,而非扩张副业。
4/16 Anthropic 发布 Claude Code Auto Mode:AI 分类器替代人工审批
Anthropic 工程博客详解 Claude Code Auto Mode 的设计机制。背景是:用户在使用 Claude Code 时对 93% 的权限申请都会同意,导致审批疲劳;而完全跳过权限则存在安全风险。Auto Mode 使用双层 AI 分类器作为中间方案——输入层扫描 prompt 注入攻击,输出层(运行在 Sonnet 4.6 上)在执行前对操作进行快速过滤(两阶段:先 yes/no,再 chain-of-thought)。关键数据:误报率从 8.5% 降至 0.4%,但对”过度主动操作”的漏检率为 17%,对合成数据泄露的漏检率为 5.7%。目前向企业和 API 用户开放研究预览,推荐在隔离沙箱环境中使用。
5/16 Google Lyria 3 Pro 上线:支持最长 3 分钟 AI 音乐生成
Google DeepMind 发布 Lyria 3 Pro,支持生成最长 3 分钟的完整音乐作品,用户可自定义前奏、主歌、副歌和桥段等完整曲目结构。目前已在 Gemini 付费订阅用户中上线,同时开放 Gemini API 和 Google AI Studio 给开发者使用;Google Workspace 用户可通过 Google Vids 访问,Vertex AI 也提供企业级大规模音频生成能力。所有 AI 生成音乐均带有 SynthID 水印标识。Demis Hassabis 亲自演示用其制作”凌晨 2 点心流状态”的背景音乐。Ethan Mollick 则指出 Lyria 是目前首个通过 API 可访问的音乐创作工具,且规避了困扰 Suno 等产品的版权争议。
6/16 Grok Imagine 推出视频故事功能,Elon 高调宣传
Elon Musk 多次为 Grok Imagine 视频故事功能站台,相关推文总浏览量超 2000 万。他发布”用 Grok Imagine 制作视频故事”的推文并配上”Make video stories with @Grok Imagine”,获超 1700 万次观看。另一条”Grok Imagine 夺金”获 620 万次观看。同期,SuperGrok Lite 新套餐正式推出,月费 10 美元,含 AI 图像和视频生成功能,为 SuperGrok 的平价版本。
7/16 xAI 任命 Benji Taylor 担任设计主管,X Money 支付布局提速
Elon Musk 宣布欢迎 Benji(Benji Taylor)加入 xAI 和 X,后者将同时负责 X、xAI 和 SpaceX 的设计工作。Benji 此前创立了 Los Feliz Engineering,打造了自托管钱包 Family 并出售给 Aave,还曾领导 Coinbase 旗下 Base 区块链的设计工作。这一任命被外界解读为 X Money 支付功能加速推进的信号,显示 Musk 正借助加密行业人才推动 X 的金融服务扩张。
8/16 Google DeepMind 与 Agile Robots 建立合作伙伴关系
Demis Hassabis 宣布 Google DeepMind 与 Agile Robots 达成合作,将 DeepMind 的 AI 模型部署到 Agile Robots 的机器人平台上,目标是解决工业领域最复杂的挑战。此次合作是 DeepMind 在机器人商业化落地上的重要进展,显示其通用 AI 模型正逐步从研究走向工业应用场景。
9/16 Andrej Karpathy:LLM 个性化记忆会造成干扰
Karpathy 发帖指出大语言模型个性化功能的普遍问题:两个月前随口问过的一个话题,会被模型持续记为”核心兴趣”并无端提及,表现出一种”用力过猛”的姿态。该推文引发广泛共鸣,获 1165 万次浏览、1.36 万点赞、669 次转推和 282 次引用。这一观察揭示了 AI 产品在记忆管理和个性化设计上的核心难题:如何区分”偶然提及”与”真实兴趣”。
10/16 Luma 发布 Uni-1:强调理解力与审美判断力的新一代图像模型
Luma 推出 Uni-1 图像生成模型,定位为”有品味的智能生成系统”。Luma 通过一系列推文描述 Uni-1 的三大核心特性:智能(理解意图后生成)、可引导(用参考图和方向替代复杂提示词)、有审美(内置视觉判断力)。Luma 将其定位为创意协作工具,而非单纯的文生图模型,当前可在 Luma 官网体验。
11/16 LangChain Fleet 上线可共享技能(Skills)功能
Harrison Chase 宣布 LangChain Fleet 支持创建、管理和共享 Skills(技能)。团队的领域知识可一次性封装成技能,附加到任意 Agent 上,并在整个组织内共享——无需重复定义。Skills 支持在 Fleet Agents 中调用,也可下载到本地的编码 Agent 中使用。同日,deepagents.js v1.9.0 alpha 版发布,新增异步子代理支持,允许后台并发运行子任务。
12/16 Google 荣登《Fast Company》2026 年全球最具创新力企业榜首
Google 被评为 2026 年《Fast Company》全球最具创新力企业第一名,亦在 AI 领域名列第一。Databricks 同日宣布入选该榜单,并列举了 Lakebase、Lakewatch 和 Genie Code 等近期创新成果。ARC Prize 基金会也获得 Fast Company 独家专访报道。
13/16 AMD CEO Lisa Su 获提名加入美国总统科技顾问委员会
AMD CEO Lisa Su 宣布获美国总统提名,将加入总统科学技术顾问委员会(PCAST),与 Michael Kratsios、David Sacks 等科技领袖共同推进美国科技领导力和创新生态建设。此次任命标志着半导体行业在美国科技政策制定层面获得更高代表性。
14/16 微软 AI 研究:多智能体语义对齐新方案
Mustafa Suleyman 分享 Microsoft AI 的最新预印本研究,指出多智能体系统中”共享语言≠共享语义”的核心问题——即不同 Agent 对同一术语的理解可能存在偏差,形成”无人监督的传话游戏”。论文提出解决方案:若 Agent 无法就某个定义达成一致,则禁止使用该术语。研究发现这种”强迫共识”机制能有效减少多智能体协作中的语义漂移。
15/16 Together AI 上线 4 款新图像生成模型
Together AI 宣布新增 4 款图像生成模型,覆盖四个不同场景:专业文本渲染、角色一致性、搜索引擎增强生成(search-grounded generation),以及将生成与编辑整合为单一工作流的统一模型。
16/16 OpenAI Model Spec 播客:AI 应该做什么、不应该做什么
OpenAI 研究员在播客节目中讨论 Model Spec——这是定义 AI 模型行为规范的公开框架。内容涵盖 Model Spec 的实际运作方式、责任链设计,以及随着 AI 能力增强,如何平衡”能做”与”应该做”之间的边界。
Deep Dive 附录
ARC-AGI-3:全球唯一未饱和 Agentic 基准
ARC-AGI-3 于 2026 年 3 月 25 日发布,是自 2019 年 ARC 基准诞生以来首次重大格式升级。前两代侧重静态推理(图形模式识别),第三代转向交互式推理——AI 需要像真人玩家一样探索游戏环境,无指令、无目标地自主发现规则。1000+ 关卡,150+ 独特环境,全部由人类测试员验证可解(至少 2/10 人能通关)。
评分方式:以人类第 2 名的动作数为基线,衡量 AI 与人类的动作效率比。当前所有前沿模型得分低于 1%(对比人类 100%),预览阶段最好成绩为 12.58%。
Chollet 强调:ARC-AGI-3 不是判断 AGI 的”期末考试”,而是追踪 AGI 进展的工具——任何在排行榜上的突然跃升,都将意味着 AGI 领域真正的突破。 查看原文
AI Scientist:Nature 认证的全自动 AI 研究系统
Sakana AI 与 UBC、Vector Institute、牛津大学合作的 The AI Scientist 论文发表在 Nature 期刊,是 AI 自主完成科研工作里程碑式的成果。系统能够:自动生成研究假设 → 检索文献 → 设计实验 → 并行运行 → 撰写 LaTeX 论文(含图表)。
关键数据:AI Scientist-v2 在 ICLR 2025 研讨会上提交论文,平均评分 6.33(高于 55% 人类投稿)。配套的自动审稿人达到 69% 均衡准确率。论文质量与底层基础模型能力呈正相关,意味着随模型迭代,系统能力将持续提升。局限:仍主要在计算实验领域运作,存在方法论不严格、幻觉引用等问题。团队已为 AI 生成论文加水印并撤回已接收稿件,体现负责任开发理念。 查看原文
Anthropic Claude Code Auto Mode:分类器替代人工审批
Auto Mode 解决的核心问题:用户对 93% 的权限申请都会批准(惯性批准),但完全跳过权限又太危险。解决方案:用 AI 分类器担任”审批人角色”。
技术实现:双层架构。第一层(输入):服务端扫描工具输出,检测 prompt 注入,发现可疑内容时发出警告。第二层(输出):Sonnet 4.6 运行的 Transcript Classifier,两阶段执行——Stage 1 做快速 yes/no 过滤,Stage 2 对标记项进行 chain-of-thought 推理。关键设计:分类器会主动剥除 Agent 的推理过程和工具输出,防止 Agent 通过自我辩护”说服”分类器批准危险操作。
效果:误报率 0.4%(人工审批的替代达成率极高),但对”越权行为”漏检率 17%,对合成数据泄露漏检 5.7%。定位:不替代高风险基础设施上的人工审查,仅替代”反正都会批”的疲劳审批场景。 查看原文
Google Lyria 3 Pro:首个可通过 API 访问的完整音乐生成系统
Lyria 3 Pro 是当前 AI 音乐生成领域技术最完善的商业化产品。支持最长 3 分钟完整曲目,用户可精细控制前奏、主歌、副歌、桥段等音乐结构,模型理解音乐语法而非仅响应文字描述。
发布范围全面覆盖:Gemini App(付费用户优先)、Gemini API 公开预览(开发者)、Google AI Studio、Google Vids(Workspace 用户)、Vertex AI(企业大规模音频生成)。所有生成内容均带 SynthID 水印。相较于 Suno,Lyria 最大差异化优势在于:无版权争议(Suno 因训练数据问题持续面临版权诉讼),且开放 API 访问,可嵌入第三方产品。 查看原文