AI Frontier Daily / 2026.08.20

Stripe 收购 OpenRouter,模型路由层并入全球支付基础设施

OpenRouter 正式宣布加入 Stripe,交易仍待惯常交割条件完成;官方未披露价格,Axios 报道估值超过 80 亿美元且以股票为主。OpenRouter 称其日处理 10 万亿以上 token、连接 400 多个模型并服务 1,000 万以上开发者与企业。公司承诺名称、产品、路线图、现有集成与模型中立路由不变,交易目标是借助 Stripe 的全球客户网络、计费和反欺诈基础设施扩大推理网关。

1/15 Stripe 收购 OpenRouter,模型路由层并入全球支付基础设施

OpenRouter 正式宣布加入 Stripe,交易仍待惯常交割条件完成;官方未披露价格,Axios 报道估值超过 80 亿美元且以股票为主。OpenRouter 称其日处理 10 万亿以上 token、连接 400 多个模型并服务 1,000 万以上开发者与企业。公司承诺名称、产品、路线图、现有集成与模型中立路由不变,交易目标是借助 Stripe 的全球客户网络、计费和反欺诈基础设施扩大推理网关。

2/15 OpenAI 用私密安全处理保留前沿模型零数据留存

OpenAI 将继续向符合条件的 API 客户提供前沿模型 Zero Data Retention,并预告 Private Safety Processing:自动系统可跨相关交互、账户探测和长时 Agent 任务识别风险模式,但 OpenAI 人员看不到底层提示词和响应。内容可留在客户基础设施,也可由客户持钥加密后存于 OpenAI;平台只接收有限风险信号。方案正与早期客户测试,计划 9 月推出并发布技术白皮书。

来源@OpenAI12@gdb@sama

3/15 Replit 用 GPT-5.6 Luna 推出 Free Mode,把日常 Agent 成本包进订阅

Replit Free Mode 由 OpenAI GPT-5.6 Luna 驱动,Core 用户每月 20 美元可在日常聊天、分析与轻量创建中不消耗 credits,官方称创建量最多提升 30 倍,并提供每月最多 30 小时聊天。使用额度每 5 小时重置,Pro 上限更高;复杂任务会建议切换到成本优化的 Power Mode 或高性能 Max Mode。产品界面也重做为聊天、设计、分析和软件构建共享上下文的一体化入口。

来源@Replit123

4/15 Cursor 让 Cloud Agent 订阅事件、守住长期目标并在独立虚拟机运行子 Agent

Cursor Cloud Agents 现在可监控 PR、Slack 线程和定时任务,事件发生时自动唤醒;它创建的 PR 会自动订阅并持续修复 CI 与机器人评论。/goal 可让 Agent 长期维持目标,skill 可固定为 Custom Mode,多个子 Agent 则可在各自独立虚拟机和项目副本中并行测试或修复。Steering 也改在下一次工具调用边界接收跟进消息,避免中途打断正在执行的动作。

来源@cursor_ai12345

5/15 NVIDIA 开源 SkillEvaluator,300 多项 skill 对照实验平均正确性提升 41 点

SkillEvaluator 在隔离环境中让同一任务、模型、输入和评分标准分别运行“安装 skill”与“未安装 skill”版本,首批覆盖 30 多个 NVIDIA 产品、300 多项 verified skills 及 Codex、Claude Code 两种 harness。8 月 12 日快照中,正确性从 46 升至 87、有效性从 39 升至 78、效率从 43 升至 78。85% 的任务只有一次尝试且未报告置信区间,因此目录平均增益不能直接外推到单项 skill。

来源@NVIDIAAI12

6/15 Google 把交互测验、个性化学习计划和一年 AI 订阅推向全球学生

Google Search 将支持为 SAT、ACT、AP、ENEM、GRE、JEE、LSAT、MCAT、NEET 等考试生成练习测验,并加入交互可视化、Lens 分步学习、项目 notebooks 和自定义文件。Gemini 学生中心用诊断测验生成个性化学习计划,Gemini Live 可口头讨论 Deep Research 报告。美国合格大学生可免费一年 AI Pro,美国以外合格学生可免费使用 AI Plus;官方推文称覆盖 140 多个国家。

来源@sundarpichai12

7/15 Pika SFX 把文本音效生成压到亚秒级,并公开扩散架构与评测边界

Pika SFX 用文本编码器、压缩声学潜空间中的扩散 Transformer 和语义—声学解码器生成 44.1 kHz 立体声音效,再以 flow matching、教师—学生蒸馏和人类反馈后训练缩短推理路径。50 个提示、454 秒请求音频的厂商基准中,自托管热路径平均 0.847 秒,并报告内容可用性和制作质量领先;对比项是托管 API,硬件与环境不统一。API 支持 1–20 秒、negative prompt、seed 和步数控制。

来源@pika_labs1234

8/15 Google AI Studio 打通 GitHub 仓库导入与双向同步

Google AI Studio 现已支持导入 GitHub 仓库,并在 Studio 与 GitHub 之间双向 push、pull;新界面还覆盖 force push、merge 等版本控制操作。此前 AI Studio 更偏向提示、模型与应用原型,这次更新把已有代码库的持续修改和回写纳入浏览器工作区。官方推文没有说明冲突处理、分支保护、权限范围和大型 monorepo 限制,生产仓库仍需按 GitHub 审查与 CI 规则控制合并。

9/15 自改进 Agent 验证分数翻倍,密封测试却没有净增益

AlphaSignal 让 GPT-5.6 Sol 从 SWE-bench 失败轨迹改写两套 worker 指令,并固定模型、工具、运行时和预算。稀疏 harness 的验证成绩从 3/10 升至 6/10,但 24 个未见任务仍为 15/24:新增一项成功同时造成一项回归;工程化 harness 的验证仅从 3/14 升至 5/14,密封集却从 13/24 升至 15/24。结果把关键风险从“能否产生修改”转向“selection gate 能否识别真实泛化”。

来源@AlphaSignalAI12

10/15 Qwen3.8-27B 登上法律 Agent 开放权重榜与 Cline 排名首位

Qwen 宣布 27B 参数的 Qwen3.8-27B 在 Harvey Legal Agent Benchmark 的开放权重模型中排名第一,并在发布四天后升至 Cline 榜首,主打可在本地硬件运行的专业任务能力。Harvey LAB 面向长时法律工作并采用严格 rubric,整体前沿模型仍未饱和;“开放权重第一”不等于全模型第一。Ethan Mollick 的实测也提醒,27B 本地模型在复杂 Agent 任务上仍明显落后于更大的前沿模型,部署前需用自身 harness 复测。

来源@Alibaba_Qwen12@emollick

11/15 Databricks Genie Code 可把手绘草图直接构造成数据看板

Genie Code 允许上传手绘看板草图,再结合用户可访问的财务数据和工作区资产自动搜索数据、创建数据集、生成可视化并处理构建问题。完成后,系统会总结生成内容、列出使用的数据集,并建议发布、添加过滤器或继续修改。流程把图像理解、企业权限内检索、数据建模与可视化生成串成单一 Agent 任务,但公告未披露复杂草图的成功率、验证规则和发布前人工审核要求。

12/15 MAI-Image-2.5 进入图像编辑第一梯队,实时榜单已从快照榜首回落到第三

Mustafa Suleyman 宣布 MAI-Image-2.5 在 Artificial Analysis 图像编辑榜升至第一;核对当前全球实时榜,模型以 1,252 Elo、9,523 个样本居第三,95% 置信区间为 ±9,与前两名 GPT Image 2 和 GPT Image 1.5 的区间高度重叠。模型官方定位是可控编辑、真实感与商业设计。该变化反映人类盲测 Elo 会随新增投票快速变化,单条“第一”应标明快照时间。

13/15 NVIDIA cuOpt 开源 GPU 优化求解器,并公布三类 Mittelmann 基准领先

NVIDIA 称 cuOpt 在 Hans Mittelmann 的三个优化问题类别中成为最快的开源求解器。项目覆盖线性规划、二次规划和车辆路径,并以 beta 支持二次约束、二阶锥与混合整数规划;核心提供 C、Python 和服务 API,也附带 Agent-first skill。官方文档同时说明 MIP 的最优性证明仍在开发,C++ API 尚未稳定,因此当前优势更适合按具体问题、GPU 和终止条件复测。

来源@NVIDIAAI12

14/15 Kimi Work 把金融研究拆成看板、模型更新和批量报告三类 Agent 工作流

Moonshot 展示 Kimi Work 面向金融分析师的第二组教程:从实时数据建立投资者看板,在电子表格中更新财务模型,并批量处理和生成报告。产品方向是让 Agent 跨网页研究、表格计算与文档产出维持同一任务上下文,而不是只回答单个金融问题。推文主要是工作流演示,没有披露数据源许可、公式审计、行情延迟或合规控制,实际财务使用仍需保留来源与人工复核。

15/15 Higgsfield 把长时多 GPU 视频推理迁到 Together AI 专用容器

Together AI 宣布 Higgsfield 成为 Dedicated Container Inference 客户;后者在完成 4 亿美元 B 轮融资后,用该服务运行 Cinema Studio 等视频模型。平台面向长时、多 GPU 任务提供自动扩缩、队列、流量隔离、重试和监控,反映生成视频的生产负载正在从单次 API 调用转向有状态作业调度。公告属于供应商客户案例,没有披露所用 GPU、吞吐、延迟、成本或迁移前后对比。


Deep Dive 附录

OpenRouter 加入 Stripe:模型路由与金融基础设施开始合并

OpenRouter 官方确认交易,但未披露金额;公司把自身规模定义为日处理 10 万亿以上 token、400 多个模型、1,000 万以上开发者与企业,推理量自 2023 年起每年至少增长 10 倍。交易完成后,OpenRouter 名称、产品、路线图、集成和模型中立承诺保持不变,路由仍按用户利益而非母公司偏好决定。Stripe 提供全球客户网络、计费、可靠性与反欺诈能力;OpenRouter 则把模型、供应商、价格、可用性和观测统一成一个 API。交易仍需惯常交割条件,预计数周内完成。 查看原文

Private Safety Processing:跨交互检测风险,但不把原文交给平台人员

传统 ZDR 安全系统逐次判断单个请求,难以识别跨多轮任务、重复探测、跨账户协调或 Agent 被要求停止后仍继续行动等模式。新方案允许自动系统在客户控制的基础设施或客户持钥加密的 OpenAI 存储上处理相关交互,只向 OpenAI 返回有限风险类型信号;平台人员即使收到警报也无法读取内容。客户可用自有日志调查,并选择是否为申诉或核实滥用共享材料。9 月将启动推出并发布白皮书;疑似 CSAM 图片的法定人工审查留存仍是例外。 查看原文

Replit Free Mode:低价模型把 token 成本从用户界面中抽走

Free Mode 由 GPT-5.6 Luna 提供日常聊天、构思、分析和轻量创建,并让上下文在聊天与复杂构建间延续。Core 用户每月 20 美元可获得官方所称最多 30 倍创建量和最多 30 小时聊天;额度每 5 小时重置,Pro 上限更高。达到限制或任务变复杂时,Agent 会建议转到 Power 或 Max。它并非无限制免费推理,而是把低成本模型、使用上限和模式切换包装成订阅体验,减少用户逐次关注 token 与 credits 的需求。 查看原文

Cursor 常驻 Agent:订阅、目标、模式和隔离子 Agent 组成执行系统

订阅让 Cloud Agent 监听 PR、Slack 与定时任务并在事件到达时恢复工作,自动跟进自己创建的 PR、修复 CI 和处理机器人评论;/goal 保持长期目标,Custom Mode 把某项 skill 固定在上下文中,/loop 可做周期检查。子 Agent 分别运行在独立虚拟机和项目副本,适合无碰撞并行修复或在干净环境验证父 Agent。新的 steering 把用户跟进排到工具调用边界,避免半途切断副作用操作。这些能力目前的事件订阅仍仅限 Cloud Agents。 查看原文

SkillEvaluator:有无 skill 的对照实验终于成为可重复发布门槛

Tier 1 检查 schema、frontmatter、安全、秘密、PII、许可证与脚本;Tier 2 用 embedding 查找内部重复和目录重叠;Tier 3 用 Harbor 在隔离沙箱中对同一任务做安装与未安装 skill 的对照,再跨 Codex、Claude Code 两个 harness 比较。目录平均正确性、有效性和效率分别提升 41、39、35 点,但 85% 任务仅一次尝试,文章未给置信区间。产品间 Skill Lift 约从 +2 到 +46,远大于 harness 间约 5 点差异;部分 skill 还会增加 token 与时长,说明评估必须下沉到单项任务和成本。 查看原文

Google 教育更新:学习 Agent 从回答问题扩展到诊断、计划和练习

Gemini study notebooks 先用诊断测验定位知识缺口,再生成分段学习计划;Gemini Live 可移动端讨论 Deep Research 报告。Search 增加交互式可视化、任意科目和标准化考试练习、Lens 分步学习、项目 notebook 与自定义文件。美国合格大学生获得一年 AI Pro 和 5 TB 存储,美国以外合格学生获得免费 AI Plus 和 400 GB 存储。教师可在 Classroom 按课程配置 AI 体验并追踪进度,使个性化学习仍受学校权限与教师流程约束。 查看原文

Pika SFX:亚秒生成来自潜空间、蒸馏和部署协同优化

模型把文本编码为声音对象、动作、环境、顺序和风格条件,在压缩声学潜空间以扩散 Transformer 生成,再解码为 44.1 kHz 立体声。flow matching 学习从噪声到音频的轨迹,教师—学生蒸馏把长路径压缩为少量步骤,人工反馈后训练提升可用性。厂商在 50 个提示、454 秒请求音频上报告自托管热路径平均 0.847 秒,并称内容可用性和制作质量领先;所列 ElevenLabs 与 Stable Audio 数值来自托管 API,不能视为同硬件独立基准。 查看原文

自改进 harness:真正难的是决定哪次修改能永久存活

GPT-5.6 Sol 只改 worker 的指令层,其他模型、工具、预算和运行时固定。稀疏 harness 的验证从 3/10 翻倍到 6/10,但密封集总成绩不变,并出现一个新增成功与一个回归;工程化 harness 的验证增益较小,密封集反而多解两题。修改确实改变了搜索策略,有的新成功甚至使用更少 API 调用,但同一偏置也会制造回归。可靠自改进需要更大验证门槛、重复运行、成对回归检查,以及把成本变化与准确率一起纳入晋升标准。 查看原文

cuOpt:开源 GPU 求解器正在进入 Agent-first 优化工作流

cuOpt 以 C++ 核心和 C、Python、服务 API 覆盖 LP、QP、车辆路径,并对 QCQP、SOCP、MIP 提供 beta 支持;它可嵌入现有建模语言和云环境,也提供面向 Agent 的开源 skill。NVIDIA 宣布其在三个 Mittelmann 类别中领先,但仓库同时标明 MIP 更擅长快速寻找高质量可行解,最优性证明仍在开发,C++ API 也可能显著变化。生产评估需固定问题集、GPU、容差、终止条件与可行性验证,不能只看单一速度排名。 查看原文