AI Frontier Daily / 2026.07.15

Demis Hassabis 提议建立 frontier AI 全球标准机构

Google DeepMind CEO Demis Hassabis 发布长文,主张在 AGI 到来前建立一个美国牵头、行业资助、专家运营的 frontier AI 标准机构,用于评估和压力测试最前沿模型。Satya Nadella、Sundar Pichai 和 Mustafa Suleyman 都转发支持,讨论重点集中在如何同时保留模型创新和选择、又避免单个模型发布造成系统性风险。这是近期大模型治理从原则声明走向具体制度设计的最强信号之一。

1/16 Demis Hassabis 提议建立 frontier AI 全球标准机构

Google DeepMind CEO Demis Hassabis 发布长文,主张在 AGI 到来前建立一个美国牵头、行业资助、专家运营的 frontier AI 标准机构,用于评估和压力测试最前沿模型。Satya Nadella、Sundar Pichai 和 Mustafa Suleyman 都转发支持,讨论重点集中在如何同时保留模型创新和选择、又避免单个模型发布造成系统性风险。这是近期大模型治理从原则声明走向具体制度设计的最强信号之一。

2/16 GPT-5.6 的叙事转向价格、效率和 agentic products 增长

Sam Altman 称 GPT-5.6 Sol 在许多同任务场景中价格约为 Claude Fable 的一半、token 效率约为两倍,相当于把完成任务的有效成本降到四分之一;他还表示 Codex 和 ChatGPT Work 等 agentic products 一周内使用量增长 2.5 倍。Greg Brockman 同时提到 GPT-5.6 已在 Bedrock 上一般可用,并展示 ChatGPT Work + Sol 做业务研究的体验。OpenAI 这轮重点不是单点 benchmark,而是把模型、工具调用、工作入口和成本效率放到同一条增长曲线上。

来源@sama123@gdb12

3/16 Grok 4.5 用速度和 token efficiency 争夺 coding agent 场景

Elon Musk 再次放大 Grok 4.5,称其登上 Long-Horizon Terminal-Bench 第一并值得尝试。xAI 官方材料把 Grok 4.5 定位为 coding、office work 和 Grok Build 的默认模型,称其以 80 tokens/s 服务,在 SWE-Bench Pro 每题平均输出 15,954 tokens,对比 Opus 4.8 max 的 67,020 tokens,价格为 $2/M input、$6/M output。讨论焦点从“最强模型”转向“每个真实 agent 任务的时间和 token 成本”。

来源@elonmusk12@AlphaSignalAI

4/16 NVIDIA 把 coding agent 变成可运行 RL 实验的 autoresearcher

NVIDIA 展示用 NeMo RL、NeMo Gym 和 verified agent skills 让 coding agent 执行端到端 RL autoresearch:给定目标和时间预算后,agent 构建训练环境、训练并评估视觉模型,Qwen3-VL-2B 在彩色星星计数任务上从 25% 提升到 96.9%,还自动提出下一轮实验。NVIDIA 把关键点放在 structured skills、长时间状态保持和可复现工作流上,说明“agent 会写代码”正在升级为“agent 能治理实验循环”。

来源@NVIDIAAI123

5/16 Perplexity 开源 WANDR,评估研究 agent 的 wide-and-deep 能力

Perplexity 发布 WANDR benchmark 和 evaluation harness,用 500 个真实风格的数据收集任务测试 research agent 是否能同时“找全”和“查深”。WANDR 要求 170,495 条 source-backed records,覆盖竞争分析、尽调、文献综述、市场分析、产品比较和人才搜寻等工作;评分器会重新抓取引用页面并逐条判断证据是否支持结论。Perplexity 称最强系统也只有 0.363 soft F1 和 0.133 hard F1,说明大规模证据型研究仍远未解决。

来源@perplexity_ai1234

6/16 Anthropic 投入 1000 万加元支持加拿大 AI 研究

Anthropic 宣布投入 1000 万加元,与 Amii、Mila、Vector Institute、CHEO、CAMH、Université Laval、University of Toronto 和 University of Saskatchewan 等机构合作,支持有益和负责任的 AI 研究。覆盖方向包括 RL、AI trust and safety、健康、可持续发展、多智能体、机器人、心理健康、低资源语言和公共服务。Anthropic 同时发布加拿大 Claude 使用简报,称加拿大在 Claude.ai 使用量全球第八,人均使用率高于人口预期四倍以上。

7/16 Meta AI 模型在亚洲物理奥林匹克理论考中拿到满分

Meta AI 称,为展示其 advanced reasoning 和 multimodal capabilities,团队提交模型参加 Asian Physics Olympiad 理论考试,并取得 30/30 满分,与前三名学生选手并列。官方推文没有披露完整技术细节,但这一类竞赛评测显示前沿模型正从数学、编程扩展到物理推理和多模态问题求解。相比只看标准选择题 benchmark,真实竞赛题更能暴露模型在长链推导、图像理解和严谨解题格式上的能力边界。

8/16 Meta Muse Spark 1.1 把付费 API、长上下文和 agent coding 打包

AlphaSignal 总结 Meta 推出 Muse Spark 1.1,这是 Meta 首个付费模型 API,价格约为 $1.25/M input、$4.25/M output。Meta 官方材料强调 1M-token context、图像/视频/PDF 多模态输入、内置搜索和引用、structured output、parallel tool calling,以及 frontend/design 和 agentic coding 能力。Replit、Cline、Box 和 OpenClaw 的背书都指向同一件事:Meta 不只是发模型,而是在进入企业 agent workload 的价格战。

9/16 LangChain 与 NVIDIA 把 open model agent harness 推向成本竞争

Harrison Chase 提到 LangChain 做了大量工作,把 coding agents 的 trace 标准化到 LangSmith,并转发 Cursor、Copilot、Pi、OpenCode session observability 相关更新。Together AI 同时发布 Nemotron 3 Ultra + LangChain Deep Agents cookbook,用 Ralph loops 和文件系统记忆实现多轮 agent 工作。NVIDIA 官方称 Deep Agents harness 下 Nemotron 3 Ultra 在 open model 中准确率领先,并以约 10x 更低 inference cost per run 挑战闭源模型。

来源@hwchase1712@togethercompute12

10/16 Bonsai 27B 把 27B 级多模态能力压进手机级 footprint

Together AI 称 PrismML 的 Ternary Bonsai 27B 是 local AI 的重要一步:27B-class multimodal capability 放进 phone-class footprint,并已可在 Together AI 试用。Hugging Face 和 Clement Delangue 也转发了 Bonsai 27B 发布,强调这是 27B 级模型首次面向手机级运行约束。当天关于 open models 的讨论还包括中国模型下载占比、speculator serving、DGX Spark 模型清单等,说明“足够强且可本地/私有部署”的模型栈仍在快速推进。

11/16 Databricks 把 Marketplace Apps 和 Genie 都指向企业数据上下文

Databricks 宣布 Apps on Databricks Marketplace 进入 Public Preview,允许用户在 Databricks workspace 中发现、安装并运行第三方 data/AI applications,同时继承 Unity Catalog 的安全、审计和细粒度权限。当天另一条内容强调 Genie 如何补足通用 AI assistant 缺少企业数据上下文的问题,并展示数据智能 coworker 的实际案例。Databricks 的方向很明确:把 agent 和 app 放进企业数据边界内,而不是把数据搬到外部助手。

来源@databricks12

12/16 LlamaParse 用对话方式生成文档抽取 schema

LlamaIndex 发布 Conversational Extract:用户上传文档后,agent 可以先草拟 extraction schema,随后通过自然语言对话修改,也可以直接使用模板。对很多 document AI 工作流来说,难点不只是 OCR 或 PDF parsing,而是把业务字段、层级结构和验证规则写成稳定 JSON Schema。LlamaParse 把 schema authoring 变成可迭代对话,意味着非工程用户可以更快把合同、票据、报告、表格等非结构化文档接入 agent pipeline。

13/16 Character.AI Lorebooks 把角色记忆扩展成共享世界知识

Character.AI 介绍 Lorebooks:创作者可以把地点、物品、事件等世界知识保存为带 keyword triggers 的 entries,让角色在聊天时自动引用相关设定。官方称带 Lore 的 Characters 会出现在 Discover 和 Search feed,发布的 Lorebooks 也会展示在 Character 和 creator profiles 中;用户可以通过网页和 app 的 Create 入口制作自己的 Lorebook。对 companion/storytelling 产品来说,这把单个角色设定扩展成可复用、可共享的世界模型。

来源@character_ai1234

14/16 Stability AI 把 Stable Audio 3.0 推向可编程创作工作流

Stability AI 宣布与 MusicHackspace 合作举办免费 hands-on workshop,面向制作人、creative coder 和对生成式音频底层技术感兴趣的用户。议程包括本地运行模型、训练自己的 LoRA、把 Stable Audio 接入 Ableton,以及基于模型构建自定义 audio tools。相比单纯“输入 prompt 生成音频”,这类活动强调可控性、本地运行、微调和 DAW 集成,说明生成式音频正在向可编程、可扩展的创作栈演进。

来源@StabilityAI123

15/16 Runway Agent 继续把视频生成产品化为短片制作流程

Runway 发布教学内容,展示如何用 Runway Agent 创作类似 Flicker 的 cinematic short films。官方表述强调“不需要大预算、不需要 studio notes”,用户可以把想法转成叙事视频。Runway 近期叙事一直围绕可发行作品而不是模型 demo:从单段生成到 agent-assisted storytelling,产品价值在于把镜头、节奏、风格和迭代过程包装成创作者能操作的工作流。视频生成竞争正在从画质转向完整制作体验。

16/16 Agent 指令文件正在成为新的自我 prompt injection 面

swyx 分享一次 GPT-5.6 Sol 长任务失败:旧的 agents.md 指令把模型困在 stage 0,导致它数小时只优化同一阶段;他称如果不了解 agents.md 内容就启动任务,相当于对自己执行 indirect prompt injection。Ethan Mollick 也提醒,流行的“anti-slop” markdown 指令文件本身可能由 AI 生成,反而把输出推向更套路化。随着 /plan、/goal、/skill 和项目级指令被广泛使用,agent 质量越来越取决于上下文治理,而不只是模型能力。


Deep Dive 附录

Demis Hassabis: frontier AI standards body

Demis Hassabis 的核心提议是把 frontier AI 的发布前评估制度化:由美国牵头、行业资助、专家运营的标准机构,持续评估最前沿模型在 cyber、bio、可能的国家安全风险和社会影响上的能力边界。公开报道把该设想类比 FINRA,并强调它应能适应模型能力快速变化,而不是静态法规。Satya Nadella 的转发把重点概括为:需要一个促进创新和选择的 frontier ecosystem,同时避免单一模型发布“breaks the world”。这使该提案成为近期最具体的行业治理方案之一。 查看原文

OpenAI: GPT-5.6 and agentic products

OpenAI GPT-5.6 的外部讨论集中在 Sol 的价格/效率和 Codex、ChatGPT Work 等 agentic products 的使用增长。OpenAI 页面强调 GPT-5.6 在 financial research、frontend generation、science workflow 和 security evals 上相对 GPT-5.5 提升;Sam Altman 则用“half price + twice token efficient”解释同任务总成本下降。Greg Brockman 的 Bedrock 可用性和 ChatGPT Work 体验补充了企业分发路径。整体信号是:前沿模型竞争正在从单次回答质量转向长任务、工具调用、产品入口和总拥有成本。 查看原文

xAI: Grok 4.5

xAI 官方介绍把 Grok 4.5 定位在 coding、Grok Build 和 office work。关键数字包括 80 TPS、SWE-Bench Pro 平均 15,954 output tokens、相对 Opus 4.8 max 约 4.2x 更少输出 tokens,以及 $2/M input、$6/M output 的 API 价格。它还强调 Excel、PowerPoint 和 Word 场景,说明 xAI 正把模型能力嵌入“能完成实际文档和业务产物”的工具链。Elon Musk 当天继续放大 Long-Horizon Terminal-Bench 和 Grok Build 使用案例,使 Grok 4.5 的竞争点更偏向速度、成本和任务完成效率。 查看原文

Perplexity: WANDR benchmark

WANDR 是 Perplexity 用来测试 wide-and-deep research 的开放 benchmark。它不是要求 agent 写一篇漂亮报告,而是要求发现足够多的合格实体,并为每个实体提供可复查证据。500 个任务共需要 170,495 条 source-backed records,中位任务约 50 个成员、每个成员 4 条记录。评分器会重新抓取引用页,检查页面可用性、摘录是否真实存在、证据是否支持 claim,并用 soft/hard F1 区分部分完成和完整完成。Perplexity 报告的低分说明今天的 research agent 仍容易在覆盖率、证据链和结构化完整性上失败。 查看原文

Anthropic: Canadian AI research

Anthropic 的加拿大计划一方面是 1000 万加元研究支持,另一方面是以 Claude credits 连接高校、医院、AI 研究所和创业生态。合作对象包括 Amii、Mila、Vector、CHEO、CAMH、Université Laval、University of Toronto 和 University of Saskatchewan。应用方向覆盖 RL、trust and safety、健康、科学、机器人、多智能体、心理健康、低资源语言和公共服务。Anthropic 同时披露加拿大 Claude 使用率高:全球使用量第八,人均使用率超过人口预期四倍,说明该投入既是科研支持,也是围绕高采用率地区建立生态。 查看原文

NVIDIA: RL autoresearch with agent skills

NVIDIA 的 autoresearch 演示把 coding agent 从“写训练脚本”推进到“执行完整实验计划”。在 NeMo RL、NeMo Gym 和 verified agent skills 支持下,agent 根据目标搭建训练环境、运行多小时实验、评估模型并提出下一步。NVIDIA 报告的示例中,Qwen3-VL-2B 在彩色星星计数任务从 25% 提升到 96.9%。重要点在 verified skills:它们充当长任务中的流程约束和记忆结构,使 agent 能保持实验状态、遵循 workflow,并为 paper-to-code 和 off-policy RL 实现提供可审计路径。 查看原文

Meta: Muse Spark 1.1 and Model API

Muse Spark 1.1 是 Meta 进入付费模型 API 的关键一步。官方材料强调 1M context、多模态输入、内置搜索和 citations、structured output、parallel tool calling,以及 frontend/design 和 coding 能力。Replit、Cline、Box 和 OpenClaw 的评论都把它放在 agentic workload 语境下,而 AlphaSignal 的推文突出其低价策略和 benchmark 表现。Meta 的方向不是只延续开源 Llama 生态,而是在闭源/付费 API 中用低价、长上下文和 tool-use 能力争夺企业和开发者 agent 工作负载。 查看原文

NVIDIA + LangChain: Nemotron Deep Agents harness

NVIDIA 与 LangChain 的 Nemotron 3 Ultra Deep Agents harness 强调“每个 agent run 的成本和成功率”。NVIDIA 称 tuned harness 让 Nemotron 3 Ultra 在 open models 中准确率领先,并以约 10x 更低 inference cost per run 对比 leading closed models。Together AI 的 cookbook 把这一点落到实现:使用 LangChain Deep Agents、Ralph loops 和文件系统记忆,让 agent 在多轮迭代中保留上下文。这个方向说明未来模型评测会越来越关注模型、harness、memory 和工具栈的组合,而不是孤立模型分数。 查看原文