AI Frontier Daily / 2026.07.10

OpenAI 正式推出 GPT-5.6,Sol/Terra/Luna 同步进入 ChatGPT、Codex 与 API

OpenAI 发布 GPT-5.6 系列,包含旗舰 Sol、平衡型 Terra 和低成本 Luna,并开始在 ChatGPT、Codex 与 API 中逐步推出。官方称 Sol 在 coding、knowledge work、cybersecurity 和 science 上提高了性能/成本比:Agents’ Last Exam 得分 53.6,Artificial Analysis Coding Agent Index 达到 80.0,并用更少 output tokens、更短时间和更低估算成本超过若干竞品设置。GPT-5.6 同时引入 ultra mode,用多个 agent 并行处理复杂任务;Sam Altman 强调企业关心的 dollars-per-task 是这次发布的核心。

1/14 OpenAI 正式推出 GPT-5.6,Sol/Terra/Luna 同步进入 ChatGPT、Codex 与 API

OpenAI 发布 GPT-5.6 系列,包含旗舰 Sol、平衡型 Terra 和低成本 Luna,并开始在 ChatGPT、Codex 与 API 中逐步推出。官方称 Sol 在 coding、knowledge work、cybersecurity 和 science 上提高了性能/成本比:Agents’ Last Exam 得分 53.6,Artificial Analysis Coding Agent Index 达到 80.0,并用更少 output tokens、更短时间和更低估算成本超过若干竞品设置。GPT-5.6 同时引入 ultra mode,用多个 agent 并行处理复杂任务;Sam Altman 强调企业关心的 dollars-per-task 是这次发布的核心。

来源@OpenAI123456@sama

2/14 ChatGPT Work 把 Codex 扩展成跨文件、跨应用的长任务 agent

OpenAI 同日推出 ChatGPT Work,称这是由 Codex 和 GPT-5.6 驱动的新 agent,可跨 apps 与 files 行动,连续处理数小时项目,把一个目标转成 documents、decks、analyses、sites 和 reports。Web 与 mobile 首批面向 Pro、Enterprise、Edu,随后扩展到 Plus 和 Business;新的 ChatGPT desktop app 将 Chat、Work 和 Codex 合并到 Mac/Windows,所有计划可用。Greg Brockman 表示 ChatGPT 与 Codex 被合并为面向“ambitious work”的 agent;Sam Altman 则强调 Codex 是 Work 产品的核心。

来源@OpenAI1234@gdb@sama

3/14 Microsoft 把 GPT-5.6 with Work IQ 接入 Copilot、M365、GitHub 与 Foundry

Satya Nadella 宣布 GPT-5.6 with Work IQ 进入 Copilot Chat、Cowork、M365 apps、GitHub 和 Foundry,覆盖 multi-step agentic work、analysis 与 content creation,并强调更强 reasoning 与更高质量输出没有牺牲效率。OpenAI 官方也单独发布“GPT-5.6 now preferred model in Microsoft 365 Copilot”页面,说明 Word、Excel、PowerPoint 和 Cowork 将受益于更少提示轮次、更深分析、更好视觉呈现和更强跨职能协作。这让 GPT-5.6 的发布不只是 ChatGPT/Codex 事件,也成为 Microsoft 办公栈的默认能力升级。

来源@satyanadella12

4/14 Meta 发布 Muse Spark 1.1,正式进入 agentic coding 与 computer-use 模型竞争

Meta AI 发布 Muse Spark 1.1,定位为 multimodal reasoning model,重点提升 tool use、computer use、coding 和 multimodal understanding。官方线程展示了 multi-app computer-use workflows:模型能在长 session 中保持上下文,在 scripting、direct UI interaction 和 batched actions 之间选择;也能从手机视频里抽取商品信息,操作浏览器创建 Facebook Marketplace listing。Meta 称该模型在内部 coding benchmark 上有竞争力,已用于 Meta 内部 coding 和 research workflows,并通过 Meta Model API 开放。

来源@AIatMeta123456

5/14 Perplexity Computer 用 GLM 5.2 post-train 出低成本 orchestrator

Perplexity 发布 Perplexity Computer 新 orchestrator model research preview。官方称该模型基于 GLM 5.2 改造并针对 Computer harness post-trained,在 Opus 0.344x 成本下达到 near-frontier performance;模型托管在美国 NVIDIA B200 GPUs 上,并内置 advisor tool,可在需要时升级到更强模型。Perplexity 后续补充成本对比:在 WANDR 上,GLM 5.2 + advisor 为 2.1x,Opus 为 6.1x,跨 benchmark 平均约为 Opus 一半成本。它显示 agent 产品正在把“模型选择”做成运行时策略,而不是静态选型。

来源@perplexity_ai123

6/14 GPT-5.6 发布后迅速进入 Cursor、Perplexity 与 Abacus 的 agent 产品层

GPT-5.6 生态采用速度很快。Cursor 宣布 Sol、Terra、Luna 已可用,Sol 在 CursorBench 上得分 67.2;Perplexity 宣布 Terra 和 Sol 进入 Perplexity 与 Perplexity Computer;Abacus AI 则发布 Max Mode,把 Fable 5 与 GPT-5.6 Sol 路由到同一个 agent 产品中,面向 SaaS apps、custom workflows、mobile apps 和 always-on trading servers。围绕 GPT-5.6 的竞争重点不只是模型本体,而是 coding bench、agent routing、workbench templates、subagents 和运行成本如何组合成可交付产品。

来源@cursor_ai12@perplexity_ai@bindureddy12

7/14 Agent UX 争议从“能不能做”转向“非程序员如何控制”

GPT-5.6/ChatGPT Work 发布后,Ethan Mollick 连续讨论产品边界:Claude Cowork 是更安全但稍弱的 Code 替代品,而 ChatGPT Work 与 Codex 的关系更难理解;他同时提醒,AI labs 从 programming 扩展到 general knowledge work 时,不能把 non-coders 当作“更少选项的程序员”,而需要更多 control 与 visibility。Matt Shumer 的早期体验也显示 Sol 能执行长时间自主项目,但他仍认为不同模型在复杂多轮 agentic loops 上各有优势。这批反馈把竞争拉向 task visibility、权限、控制界面、命名清晰度和适合普通知识工作者的 agent 操作方式。

来源@emollick12@mattshumer_123

8/14 Anthropic 任命 Ben Bernanke 进入 Long-Term Benefit Trust

Anthropic 宣布前美联储主席、Brookings Distinguished Fellow、2022 年诺贝尔经济学奖得主 Ben Bernanke 加入 Long-Term Benefit Trust。LTBT 是 Anthropic 的独立治理结构,职责是监督公司在商业成功与长期公共利益之间保持平衡,并可任命董事会成员、就关键决策向董事会和管理层提供建议。Anthropic 把 Bernanke 的背景与 AI 对经济、劳动力和制度设计的影响相连:随着 advanced AI 对工作与经济产生更深影响,公司需要能理解系统性冲击和宏观治理的人参与监督。

9/14 NVIDIA Flex-Forcing 把 video diffusion 的双向与自回归路线放进同一模型

NVIDIA Research 发布 Flex-Forcing,并称其获 ICML 2026 spotlight。该方法面向视频生成,把 bidirectional diffusion 和 autoregressive generation 放入同一训练与推理框架:前者同时关注多帧,结构稳定但速度较慢;后者逐帧生成,适合 streaming 与长视频但容易累计误差。Flex-Forcing 通过 flexible chunking 同时控制时间维度和 denoising steps,让单一模型在推理时按 compute budget 和输出需求切换生成方式。这说明视频生成竞争正在从单次 clip 质量延伸到长程一致性、速度、成本和可控推理路径。

来源@NVIDIAAI123

10/14 Pika 把 Director’s Suite 与 4K-VFX 做成视频生产 workflow

Pika Labs 继续把视频生成从单 prompt 工具推进到 production workflow。Director’s Suite 的演示中,系统先分析故事组件、生成 shot list、pacing notes 和 tone check-in,再用 reference images 形成视觉美学,最后生成镜头、搭建 timeline、添加 titles、music 和 sound effects;用户可通过 chat 继续调整节奏和场景。Pika 同时上线 4K-VFX Skill,称可用简单 prompt 改变视频中的对象,同时保留 faces、gestures、audio 与 camera moves。视频产品的竞争点正在转向 project memory、editability 和后期控制。

来源@pika_labs1234567

11/14 Runway Dev 把生成式媒体模型打包为 enterprise-grade platform

Runway 发布 Runway Dev,称开发者可在一个 enterprise-grade platform 中访问 Seed Audio 1.0、Seedance Mini、Seedance 4K、Google Omni Flash、Seedream 5.0 Pro 等媒体模型。Runway 的定位不是单个创作者工具,而是供 professional developers 与 enterprise teams 构建广告、电商、游戏、搜索等场景的 AI media infrastructure。与 Pika 的 Director’s Suite 类似,Runway Dev 说明生成式媒体公司正把产品重心从 consumer interface 转向 API、模型组合、企业治理与稳定交付。

来源@runwayml12

12/14 Microsoft AI 发布 Ode Poetry,把 audio model 用在“poetry pharmacy”

Mustafa Suleyman 介绍 Ode Poetry,称它是一个由 Microsoft AI audio models 支持的 poetry pharmacy:用户描述当下感受,Ode 会根据诗歌专家 William Sieghart 的推荐逻辑匹配一首诗并朗读。Suleyman 将其定位为 humanist AI demo,强调技术不是替代人类创造力,而是帮助更多人接触诗歌体验。Ethan Mollick 也评价这是更“beautiful, humane”的 AI 展示。与当天大量 agentic work、coding 和 benchmark 消息相比,Ode 代表了另一类产品方向:用生成式音频和推荐系统降低文化内容的进入门槛。

来源@mustafasuleyman12@emollick

13/14 Suno 升级歌词写作,把音乐创作从 prompt 扩展到编辑器内协作

Suno 宣布 Web 端歌词写作升级:用户可以用自己的 writing samples 创建同风格 lyricist,高亮单词获得押韵建议,高亮一行生成四个替代版本,也可以直接用自然语言在 chat bar 说明想要的修改;同时歌词会自动保存,降低反复试写时丢失内容的风险。这个更新不是新音频模型发布,而是把生成能力嵌入创作编辑器的细粒度交互中:创作者在写作、改写、风格迁移、押韵与版本管理之间来回切换,不再只依赖一次性歌曲 prompt。

来源@suno12345

14/14 开源与数据集信号继续围绕 AI sovereignty、video data 和本地推理展开

Yann LeCun 再次强调,AI 最大风险之一是少数 proprietary AI assistants 集中权力,AI sovereignty 的解法是 open source foundation models;Andrew Ng 也把 permissionless innovation 与保护 open source AI 相连。Hugging Face 方向上,Clement Delangue 注意到 Netflix 发布 video datasets 和 models,希望其视频 AI 团队继续开源更多成果;他还转发了 MOSS Transcribe 系列、Reachy Mini 和 llama.cpp 本地推理相关动态。这些消息共同说明,闭源 frontier agent 的商业加速正在伴随开源模型、开放数据、本地推理和主权 AI 讨论升温。

来源@ylecun@AndrewYNg@ClementDelangue1234

Deep Dive 附录

OpenAI GPT-5.6

GPT-5.6 是今天最核心的发布:Sol、Terra、Luna 分别对应旗舰、平衡和低成本层级,并在 ChatGPT、Codex、API 中逐步开放。OpenAI 的官方叙事集中在“performance per dollar”:Sol 在 Agents’ Last Exam、Artificial Analysis Coding Agent Index、BrowseComp、OSWorld 等长程工作与 agentic 评测上刷新或接近最佳结果,同时降低 token、时间和估算成本。另一个重要变化是 ultra mode,它把单模型回答扩展为多 agent 并行工作流,面向更高 token 使用但更强、更快的复杂任务。发布也强调更好的 artifact quality:演示和文本都把 presentations、documents、spreadsheets、computer use、design judgment 放在同一套“真实知识工作”框架里。 查看原文

ChatGPT Work

ChatGPT Work 是 GPT-5.6 发布中更偏产品化的一半。OpenAI 将它描述为“partner for ambitious work”:它把 Codex 的长任务执行能力放进 ChatGPT,可读取用户选定的 apps 与 files context,并生成文档、演示、分析、网站和报告等可交付物。发布节奏也体现了产品整合:desktop app 把 Chat、Work、Codex 合到 Mac/Windows;web/mobile 先覆盖 Pro、Enterprise、Edu,再扩展到 Plus 与 Business。围绕这个产品的早期争议也很清晰:它需要解释自己与 Codex、Claude Cowork 和普通 ChatGPT 的边界,并给非程序员足够的控制感、可见性和安全护栏。 查看原文

Meta Muse Spark 1.1

Muse Spark 1.1 是 Meta 进入 agentic coding/computer-use 竞争的关键一步。官方页面称它是面向 agentic tasks 的 multimodal reasoning model,重点升级 tool use、computer use、coding 和 multimodal understanding。Twitter 线程补充了几个产品化场景:跨 app 维护上下文、根据情况选择脚本或 UI 操作、从视频中抽取商品信息并代用户操作浏览器,以及支持 Meta 内部 coding/research workflows。与开源 Llama 路线不同,Muse Spark 1.1 通过 Meta Model API 进入付费/企业模型层,代表 Meta 把 agentic model capability 与 API monetization 绑定。 查看原文

Perplexity Computer orchestrator

Perplexity 的新 orchestrator model 把 agent cost engineering 推到前台。官方称该模型基于 GLM 5.2 并为 Computer harness post-trained,提供 near-frontier performance,成本为 Opus 的 0.344x;其 advisor tool 会在需要时自动升级到更强模型。这个结构不同于单一模型替换,而是将“何时使用便宜模型、何时升级强模型”产品化。Perplexity 后续还用 WANDR 成本对比说明 GLM 5.2 + advisor 和 Opus 的成本差异,显示 Computer 这样的 agent 产品正在把 routing、advisor、GPU 托管和 benchmark reporting 作为核心卖点。 查看原文

NVIDIA Flex-Forcing

Flex-Forcing 试图统一视频生成里的两种推理范式。Bidirectional diffusion 更擅长保持整体结构,因为它可同时关注多个帧;autoregressive generation 更适合 streaming 和长视频,因为它逐帧推进,但可能随时间漂移。NVIDIA 的方法用 flexible chunking 同时控制 temporal dimension 与 denoising steps,使同一模型能在推理时选择偏结构一致、偏速度/长度,或二者之间的混合路径。它的重要性在于,视频生成正在从“单段视频是否好看”转向“能否按预算、长度、连贯性和交互需求选择生成策略”。 查看原文

Anthropic Long-Term Benefit Trust / Bernanke

Anthropic 任命 Ben Bernanke 加入 Long-Term Benefit Trust,把 advanced AI governance 与宏观经济经验直接连接。Anthropic 称 LTBT 是独立机构,负责帮助公司在商业目标与长期人类利益之间保持平衡,并可向董事会和管理层就 AI 风险、社会影响和关键决策提供建议。Bernanke 的背景覆盖中央银行、金融危机、宏观经济研究和制度应对,这与 Anthropic 当前强调的 AI 对 workforce、economies 和 institutions 的影响相匹配。这条消息不是产品发布,但说明 frontier labs 争夺的不只是模型能力,也包括可信治理结构和社会影响判断。 查看原文