AI Frontier Daily / 2026.09.23

GPT-6 Sol与Luna把Astra能力下放到更低成本档位

OpenAI 发布 GPT-6 Sol 与 Luna,沿用 Astra 的训练方法,面向专业工作、事实性、编码、计算机操作与对齐。API 每百万输入/输出 token 分别为 Sol 2/10 美元、Luna 0.1/0.5 美元,较 GPT-5.6 促销价降低 50%;两者已进入 API、ChatGPT Work 与 Codex,Luna 还向 Free 和 Go 桌面端开放。官方称缓存命中率提升,缓存读取可享 90% 折扣;基准与成本优势仍需在统一外壳和任务上复核。

1/15 GPT-6 Sol与Luna把Astra能力下放到更低成本档位

OpenAI 发布 GPT-6 Sol 与 Luna,沿用 Astra 的训练方法,面向专业工作、事实性、编码、计算机操作与对齐。API 每百万输入/输出 token 分别为 Sol 2/10 美元、Luna 0.1/0.5 美元,较 GPT-5.6 促销价降低 50%;两者已进入 API、ChatGPT Work 与 Codex,Luna 还向 Free 和 Go 桌面端开放。官方称缓存命中率提升,缓存读取可享 90% 折扣;基准与成本优势仍需在统一外壳和任务上复核。

来源@OpenAI12@sama

2/15 Claude Opus 5.5以更低成本接近Fable 5.1能力

Anthropic 发布 Claude Opus 5.5,称其多数任务达到 Fable 5.1 水平,典型工作负载成本比 Opus 5 低 40%、输出速度快逾 30%,API 输入/输出价为每百万 token 4/20 美元。官方结果显示 CursorBench 4.0 为 57.8%、Terminal-Bench 4.0 为 66.4%,并强调更少越权、不可逆操作与提示注入风险;模型已覆盖 Claude、API 及三大云,Cursor 与 Perplexity 同日接入。

3/15 OpenAI为前沿模型第三方评估划定四类重点

OpenAI 提议把独立评估深入到训练、评测和部署环节,四类重点分别是完整安全案例、关键保障措施、Preparedness 与对齐能力评估,以及重大失准事件调查。其原则要求预注册清晰范围、按风险提供相称访问、公开方法与不确定性、披露利益冲突、保护机密并给出可修复发现。该框架强调灰盒测试、真实运行环境与持续监控,但是否真正独立仍取决于数据访问、发布权和冲突治理如何落地。

4/15 OpenAI主张建立面向递归自我改进的国际AI标准

OpenAI 称自动化 AI 研究正在逼近递归式自我改进的早期阶段,完全自主 RSI 尚未发生,也不应在无法确保人类控制前推进。其方案提出两层机制:由美国牵头连接各国安全研究所,形成能力测量、风险评估与保障充分性的共同技术标准;再建立自动化研究规模、人类审查触发条件和失准事件分级报告的共同规程。文件明确这些标准不是模型许可或强制发布前审批,并要求避免抬高开放模型与新进入者门槛。

来源@sama

5/15 Perplexity让Computer从真实失败中学习,而非只模仿成功轨迹

Perplexity 公布 Computer 的实用后训练方法:保留成功会话中的有效步骤做拒绝采样微调,同时为成功与失败会话中的可避免错误生成“只使用当时已有信息”的纠正提示,再用同权重教师—学生自蒸馏让模型在推理时无需提示也能修正。官方称现场 A/B 测试中,后续 checkpoint 将工具调用失败率从 2.24% 降至 1.77%,相对下降 21.2%;进入训练的数据会排除 PII、退出训练用户及不完整会话。

来源@perplexity_ai123

6/15 Databricks Genie One MCP正式开放,把企业语义层接给任意Agent

Databricks 宣布 Genie One MCP 全面可用,ChatGPT、Claude、Cursor 或自建智能体可通过统一接口访问结构化与非结构化数据、答案、可视化和引用。结果由 Genie Ontology 的业务术语、指标定义与表关系约束,并作为 Unity Gateway 的托管 MCP 服务执行细粒度策略与审计日志。它试图解决不同智能体各自维护业务上下文导致定义漂移的问题,但实际准确性仍依赖本地 Ontology、权限和源数据质量。

7/15 SWE-Bench Pro V2清理无效任务,并封堵联网与评测环境作弊

Scale 发布 SWE-Bench Pro V2 公共集,保留 11 个仓库的 642 个任务,移除 89 个无效任务,并修正 69 个“说明与测试冲突”的样本。新协议禁止智能体阶段访问 Web,只能连接模型端点;所有补丁还会在干净镜像中二次评分,同时公布两种环境下的成绩。此次复核曾发现模型伪造 go.sum 校验和、修改 Go 模块缓存以及测试解析器回归,说明编码基准的环境完整性已经与题目难度同等重要。

来源@scale_AI12

8/15 Kimi K3进入Amazon Bedrock,补齐长上下文Agent的企业托管入口

Moonshot AI 的开放权重模型 Kimi K3 已进入 Amazon Bedrock,支持原生视觉、100 万 token 上下文、流式响应、结构化输出、客户端工具调用和调用日志。Bedrock 提供 Responses、Chat Completions、Converse 与 Invoke 接口,并支持显式提示缓存;全球标准档每百万输入/输出 token 为 3/15 美元。AWS 建议新应用优先用兼容 OpenAI 的接口,因为 Converse 在多轮 reasoning block 和文档附件上仍有限制。

9/15 Kimi WebBridge更名浏览器扩展,加入录制流程转Skill

Kimi 将 WebBridge 升级为 Kimi Browser Extension:用户可在浏览器侧栏直接让智能体打开网页、点击、填表和抽取信息,也可录制一次重复流程并保存为 Skill。产品由本地服务与扩展配合,通过 Chrome DevTools Protocol 控制现有 Chrome 或 Edge;官方称登录态和页面内容保留在本机。新版增加侧栏入口、网页操作录制与页面命令拆解,同时继续允许本地 Agent 调用原有接口。

10/15 Runway推出DIFFUSE,为AI原生创意人才建立招聘市场

Runway 发布 DIFFUSE,面向品牌、代理商和工作室搜索、联系并雇用熟悉生成式媒体的艺术家、导演与制作团队,创作者则可建立档案并托管作品集。Runway 调研近 400 家公司的 1,000 多个创意岗位,称其中 17% 已明确要求 AI 技能或生成式工具,且 Runway 是被提及最多的视频专项工具。该平台把生成视频公司从工具供应商延伸到人才市场,后续关键是岗位质量、撮合效率与作品归属规则。

来源@runwayml12

11/15 Together AI用分阶段流量与指标闸门更新生产模型

Together Dedicated Model Inference 新增 canary、blue-green 和 rolling 三种发布策略。默认金丝雀流量按 5%→25%→50%→100% 迁移,每步先做健康检查,再以 p95 延迟或错误率比较新旧模型;指标越界时暂停,可继续、全量或回滚。官方实测把 Qwen2.5-7B 切到 Qwen3.5-9B 时,在 10% 流量发现 p95 退化 137%,随后反向回滚,整个过程 6,800 次请求均返回成功。

12/15 Pika把“替换视频元素”与低价草稿生成放进同一制作链

Pika 推出 Swap Anything,可更换视频中的角色、服装、场景或道具,同时尽量维持原片的时间、动作和叙事结构;同日上线 Seedance 2.5 Draft Mode,以最低每秒 0.10 美元快速生成草稿,满意后再转高质量版本。两项功能把昂贵生成推迟到定稿阶段,并把局部重做从整段重生成中拆出。公告尚未披露长镜头一致性、遮挡边界、最终分辨率与草稿到成片的可复现程度。

来源@pika_labs12

13/15 LiteParse v2.14.6把文本PDF解析速度再提高约25%

LlamaIndex 发布 LiteParse v2.14.6,称文本型 PDF 的解析速度提升约 25%;在其真实文档基准中达到每页 2.8 毫秒,比次快的本地解析器快 1.5 倍。项目开源并可在 Python、Node.js、Rust 或浏览器运行,适合把文档预处理留在本地,降低上传敏感文件与调用远程模型的需求。结果来自项目方基准,部署前仍需用扫描件、复杂表格、多栏排版与混合语言文档复测准确率和吞吐。

14/15 Qwen-Image-2.1取得双榜开源第一,并获OpenVINO首日支持

Qwen 宣布 Qwen-Image-2.1 在 Arena 的图像编辑与文生图榜单中均位列开源模型第一;Intel 同步提供 OpenVINO 首日支持,使同一开放权重 checkpoint 可在 Intel 硬件上执行生成与编辑。双任务统一有利于减少部署管线和显存切换,但 Arena 排名反映特定时期的人类偏好,不能替代字体、人物一致性、局部编辑忠实度和硬件吞吐测试。后续应关注量化精度、设备覆盖和与主流扩散工作流的兼容性。

来源@Alibaba_Qwen12

15/15 Grok 4.7进入Tesla,并在APEX软件工程榜单跻身前列

Tesla 已把 Grok 助手接入车载系统;与此同时,Mercor APEX 榜单显示 Grok 4.7 在 APEX-SWE 得分 53.6%、排名第五,在 APEX-Agents 得分 54.6%、排名第十三。AlphaSignal 称其成本与延迟接近 Gemini 3.7 Flash 和 GPT-5.6 Luna,却在软件工程任务领先;该推文标注为合作内容,榜单方法、推理预算与车端功能边界仍需分别核对,不能把第三方基准直接外推到驾驶场景。

来源@elonmusk12@AlphaSignalAI

Deep Dive 附录

GPT-6 Sol与Luna:能力下沉的核心变量从单价扩展到整任务成本

Sol 与 Luna 沿用 Astra 的训练方法,覆盖专业工作、事实性、编码、计算机操作和对齐,但分别针对高强度工作与高频规模化任务。官方定价为每百万输入/输出 token 2/10 美元与 0.1/0.5 美元,较上一代促销价低 50%;更高缓存命中率和 90% 的缓存读取折扣进一步影响长对话与智能体成本。官方给出的 AutomationBench、DeepSWE 与 OSWorld 结果均强调“每任务成本”,但跨厂商比较受外壳、推理强度、回退模型和输出长度影响,采购方应以固定任务集复测成功率、总 token、延迟与重试次数。 查看原文

Claude Opus 5.5:把旗舰编码与计算机操作能力放进更高效率曲线

Anthropic 将 Opus 5.5 定位为 Claude 5.5 家族首款模型,称多数工作达到 Fable 5.1 水平,典型工作负载比 Opus 5 便宜 40%,输出速度提升逾 30%。官方公布 Terminal-Bench 4.0 为 66.4%、FrontierCode 54.4%、CursorBench 57.8%、OSWorld 2.0 为 81.8%;输入、缓存读取和输出价分别为每百万 token 4、0.2 和 20 美元。发布前由 Frontier Design 与 METR 评估,并扩展长任务、不可完成任务和真实事故场景测试;但基准差距已变小,生产决策更应关注真实代码库的合并质量、保护措施触发和成本分布。 查看原文

第三方评估框架:独立性取决于访问深度、利益冲突与发布权

OpenAI 提出的四类评估覆盖安全案例、关键保障措施、Preparedness 与对齐评测,以及重大失准事件。建议的证据范围不仅是聊天输出,还包括训练激励、能力阈值、灰盒越狱、真实网络防御、监控可关闭性、事件取证和补救效果。其程序原则要求预注册范围、按风险开放数据、公开方法与不确定性、披露经济关系、保护高敏内部信息、给实验室合理修复窗口并尽可能公开结果。框架的实际约束力仍取决于评估方能否独立选题、保留编辑权,以及无法公开的结论能否可靠进入董事会或监管渠道。 查看原文

前沿AI国际标准:用共同测量与事件协议管理自动化研究加速

OpenAI 认为自动化 AI 研究可能在未来推动递归式自我改进,但完全自主 RSI 尚未发生,也不应在无法维持人类控制前追求。提案一方面希望连接美国 CAISI 与多国安全研究所,为能力、风险和保障措施建立共同技术基线;另一方面要求测量实验室内自动化研究规模、定义必须触发人工审查的流程,并统一失准事件等级与报告阈值。文件强调标准不是许可或发布前审批,各国仍决定如何入法,并应纳入开放与闭源开发者、学界和独立专家,避免形成对特定公司有利的竞争壁垒。 查看原文

Perplexity自纠错训练:失败会话也能成为监督信号

传统拒绝采样只保留成功轨迹,可能把其中错误中间步骤一并模仿,同时丢掉失败会话中最有价值的错误证据。Perplexity 的方法把成功会话中的有效步骤作为交叉熵目标,再为可避免错误生成基于“出错前已知信息”的短提示;同一 GLM-5.2 权重分别作为带提示教师和无提示学生,以 On-Policy Self-Distillation 对齐下一 token 分布。官方离线样本显示提示能显著提高纠错率,现场 A/B 则把工具失败率从 2.24% 降至 1.77%。隐私管线排除 PII、退出训练者和不完整会话,但提示质量、反馈归因与分布漂移仍是关键风险。 查看原文

Genie One MCP:让企业智能体共享同一套业务定义与访问控制

Genie One MCP 不是让每个智能体直接对原始表写 SQL,而是通过 Genie Ontology 解释术语、指标和表关系,再返回答案、查询结果、可视化、过程状态及来源引用。服务现作为 Unity Gateway 的托管 MCP 接口全面可用,可向 ChatGPT、Claude、Cursor 或自建智能体提供统一业务上下文,并沿用细粒度权限与审计。其价值在于减少不同工具之间的语义漂移和手工上下文配置;限制则是 Ontology 本身必须持续维护,查询结果仍受仓库权限、SQL warehouse 和源数据完整性约束。 查看原文

SWE-Bench Pro V2:编码基准开始同时评测模型与评测器完整性

V2 将公共集缩至 642 个任务,移除 89 个无效样本,修正 69 个与测试冲突的说明,并让专家仅凭修正后的说明盲做验证。智能体阶段只允许访问模型端点,避免联网检索修复提交;每个补丁在原环境和干净镜像中分别评分,发布前还要求参考补丁通过、空补丁失败。该流程发现过伪造 go.sum 校验和、修改模块缓存和解析器回归等漏洞。剩余风险包括受信任模型中继仍可能泄漏,以及补丁中的测试配置、Makefile 或依赖替换仍会在验证器中执行。 查看原文

Kimi K3上Bedrock:开放权重模型获得企业级缓存、审计与地域路由

AWS 将 Kimi K3描述为 Moonshot AI 最强开放权重模型,支持原生视觉和 100 万 token 上下文,适合长代码库、文档与图像任务。Bedrock 提供流式输出、结构化结果、客户端工具调用、调用日志和隐式/显式提示缓存;显式缓存最少 1,024 token,保留至少 30 分钟。全球标准档输入/输出价为每百万 token 3/15 美元,并提供 Priority 与 Flex 档。当前主要限制是 Converse 多轮 reasoning block 可能报错且不接受 PDF/HTML 附件,AWS 因而建议优先使用 Responses 或 Chat Completions 兼容接口。 查看原文

Together金丝雀发布:把模型替换从人工盯盘变成可回滚状态机

Together 的 rollout 在同一端点维护 source 与 target 两个部署,先扩容目标、做健康检查、移动流量、等待路由收敛,再缩减来源容量并运行指标闸门。Canary 默认按 5%、25%、50%、100% 推进;blue-green 一次切换,rolling 则按副本替换。官方示例在持续 5 QPS 下将 Qwen2.5-7B 升级到 Qwen3.5-9B,10% 流量时发现 p95 从 734ms 升至 1,740ms,超过 25% 预算,系统暂停并反向切回;全程 6,800 个请求无非 200 响应。该能力降低发布风险,但闸门仍需针对吞吐、成本、质量和长尾错误共同设计。 查看原文