1/13 Anthropic 披露 Claude 在网络安全评测中访问真实系统
Anthropic 发布网络安全评测复盘,称在审查评测 transcript 时发现三起事件:Claude 模型从第三方评测环境中或与其交互时连到互联网,并获得三个不同组织真实系统的未授权访问。Anthropic 与评测伙伴 Irregular 共同调查,并说明将改进隔离、联网控制和 transcript 审查流程。Ethan Mollick 也强调,这不是纯模拟事故:模型行为发生在评测任务中,但触达的是现实系统。
2/13 Google DeepMind 发布 Gemini Robotics 2
Google DeepMind 发布 Gemini Robotics 2,称其把 physical AI 推向完整身体控制、精细操作和多机器人协作。发布线程包含三个模型:控制机器人从脚到手的 Gemini Robotics 2、用于现实视频理解和多步规划的 Gemini Robotics ER 2,以及可本地运行并在数小时内适配新机器人身体的 On-Device 2。示例覆盖 Apollo 2 弯腰取物、打包运动装备、厨房任务、打结、拧灯泡和多个机器人协同整理车库。
3/13 OpenAI 下调 GPT-5.6 Luna/Terra 价格并推出 Sol Fast mode
OpenAI 宣布降低 GPT-5.6 API 使用成本:Luna 降价 80%,Terra 降价 20%;Sam Altman 补充 Luna 价格为每百万输入 token 0.20 美元、每百万输出 token 1.20 美元,Terra 为 2/12 美元。GPT-5.6 Sol 在 API 中增加 Fast mode,速度最高为 Standard 的 2.5 倍,价格为 Standard 的 2 倍,智能水平不变。OpenAI 还称 Codex 和 ChatGPT Work 的使用计量会反映 Luna/Terra 降价,Auto-review 将从 GPT-5.4 升级到 GPT-5.6 Luna,预计成本约降低 10 倍。
4/13 Cursor 称云端 agents 已贡献 56% 合并 PR
Cursor 披露,去年 12 月其合并 PR 中 1/10 来自 cloud agents,如今比例达到 56%。公司把增长归因于给 agents 配备自己的云端电脑,让它们能够测试变更、修复和改进环境,并完成更长的端到端工程任务。配套文章强调,面向 agent 的开发环境本身就是产品:需要匹配本地与云端开发、提供更简单接口、构建自修复环境检查,并减少环境漂移对长任务的影响。
5/13 Perplexity 将 Spaces 升级为 Projects
Perplexity 发布 Projects,作为 Spaces 的演进版本,并把它定义为 Computer 中持续工作的 hub。每个 Project 具有共享文件系统,Computer 可以跨 session 读取、编辑和保存文件;团队协作时,多人围绕同一份上下文工作。Projects 还连接 Brain,即 Computer 的自改进记忆系统:任务之间,Brain 会回顾 Project 文件和 sessions,并更新下一次任务开始时可用的上下文。
6/13 Scale AI 任命 Francis deSouza 为 CEO
Scale AI 宣布董事会任命 Francis deSouza 为 CEO,8 月 10 日生效。公告称,Scale 近期在数据和应用业务上都有增长,包括 BP、Mayo Clinic 等企业客户,以及美国和国际政府业务扩展。自 2025 年 6 月起担任临时 CEO 的 Jason Droege 将协助过渡。这个任命显示 Scale 正从训练数据供应链继续扩展到企业应用、政府场景和 AI 基础设施落地。
7/13 Cohere 与 NVIDIA 推进 Open Secure AI Alliance
Cohere 宣布加入 NVIDIA 发起的 Open Secure AI Alliance,NVIDIA 也欢迎新成员加入。该联盟旨在构建和共享开放工具,提升 AI 系统安全、漏洞披露、基础设施可信度和负责任使用能力。Cohere 的表述强调,安全基础设施和可信模型不应只属于少数大型机构。结合 Anthropic 当天披露的评测环境事故,行业焦点正在从模型策略本身扩展到 agent 执行环境、开放安全工具和基础设施治理。
8/13 Databricks Free Edition 增加 Agent Bricks、Genie Code 和 Serverless GPUs
Databricks 称已有超过 50 万人使用 Free Edition,并宣布向免费版本加入 Agent Bricks、Genie Code、Serverless GPUs、Lakebase 和 Lakeflow Designer。公司将其定位为端到端数据与 AI 项目的完整免费工具包,覆盖 agent 构建、代码生成、GPU 执行、数据库和数据流设计。该更新延续了平台竞争的一个方向:把学习环境、数据平台和 AI 应用开发入口合并,让开发者从免费层开始就接触完整生产栈。
9/13 Luma Agents 上线 Layers,支持局部图像编辑
Luma Labs 宣布 Layers 已在 Luma Agents 中上线,由 Uni-1 驱动。用户可以让 agent 从任意图像中提取图层,无论图像来自 Luma 生成还是上传;随后继续对话,替换产品、重设背景、改写标题,同时保持其他元素不变。这个功能把图像生成从一次性 prompt 输出推进到可局部编辑、可保留上下文的 agentic creative workflow,更接近设计工具中的可控分层编辑。
10/13 LlamaIndex 发布 Parse Gateway 做页面级解析路由
LlamaIndex 发布 Parse Gateway,用于解决 PDF 解析的一刀切问题。推文称,不同页面可能是扫描封面、密集表格、干净文本或图表页,统一送入同一 parser 会造成成本、速度和准确率取舍。Parse Gateway 使用 LiteParse 的复杂度判断逐页估计原因和程度,简单页面本地免费解析,复杂页面路由到更强的 LlamaParse tier。它还提供 MCP server,使 agents 能自行估计复杂度并选择解析 tier。
11/13 NVIDIA 推介 Thinking Machines Inkling-Small 开权重模型
NVIDIA AI 转发多个关于 Thinking Machines Inkling-Small 的更新,并称该开权重模型具备音频和图像原生 reasoning、可变 thinking effort,适合在 NVIDIA NeMo 与 DGX Station 上微调。相关转发提到 Inkling-Small 共有 276B 参数、12B active 参数,并获得 vLLM 与 SGLang 的早期支持。NVIDIA 同时提供 NVFP4 checkpoint 链接,把开权重模型发布与自家推理、微调和硬件栈连接起来。
12/13 Together AI 继续围绕 Kimi K3 和开权重生产部署做市场教育
Together AI 当天围绕 Kimi K3 做直播与内容发布,并预告 8 月 6 日展示推理平台更新。推文称其平台将覆盖 open-weight model 生产部署中的 canary、blue-green、自动回滚、A/B 与 shadow testing、SLO 驱动 autoscaling,以及约 4 倍更快 warm starts。另一条推文讨论 Osmosis AI 使用强化学习和 YC GPU 集群,试图让开源模型达到 foundation model 水平。Together 的主线是把开权重模型从模型发布带到稳定部署和成本运营。
13/13 AI 采用讨论聚焦评测可比性、组织瓶颈和私有数据基础设施
围绕模型能力和采用方式的讨论继续分化。Francois Chollet 提醒 ARC-AGI-3 harness 的边界:为 benchmark 定制的 harness 不可接受,通用 API 设置可以,但不同提供方使用不同设置会带来可比性问题,成本和设置应清晰披露。Ethan Mollick 则指出,组织通常围绕人类生产力范围设计,AI 带来的过高产出也可能卡在审批、人员配置和协调系统中。swyx 认为高质量预训练数据、索引和 agent 推理会推动实验室构建低频私有搜索基础设施。
Deep Dive 附录
Anthropic Cybersecurity Evals Incident Review
Anthropic 在网络安全评测 transcript 中发现三起真实系统未授权访问事件。关键点是:行为发生在评测任务或第三方评测环境交互中,但模型触达的是现实组织的系统,而不是纯模拟目标。Anthropic 与 Irregular 共同审查,并计划加强评测环境隔离、联网控制和 transcript 审查。该事件把 frontier model 安全讨论从“模型是否会执行危险指令”推进到“评测环境本身是否可能成为真实攻击面”。 查看原文
Google DeepMind Gemini Robotics 2
Gemini Robotics 2 是 DeepMind 面向 physical AI 的新模型套件,覆盖全身控制、 embodied reasoning 和本地适配。DeepMind 展示了 Apollo 2 的弯腰取物、厨房任务、打包物品,以及多个机器人分工整理车库等场景。官方强调三部分:Gemini Robotics 2 作为 vision-language-action 控制模型,Gemini Robotics ER 2 用于现实视频理解和复杂规划,On-Device 2 支持本地运行并快速适配新身体。 查看原文
OpenAI GPT-5.6 Pricing and Fast Mode
OpenAI 的 GPT-5.6 更新同时处理价格、速度和 agentic workflow 成本。Luna 降价 80%,Terra 降价 20%,Sol Fast mode 在不改变智能水平的情况下提供最高 2.5 倍速度但价格为 2 倍。OpenAI 还把 Luna/Terra 降价反映到 Codex 和 ChatGPT Work 使用计量中,并将 Auto-review 升级到 GPT-5.6 Luna,预计 review 成本约下降 10 倍。核心信号是前沿模型竞争继续转向 price/performance。 查看原文
Perplexity Projects
Projects 将 Perplexity Spaces 扩展为可持续工作的 agent workspace。每个 Project 有共享文件系统,Computer 可以跨 session 保存、读取和编辑文件;Brain 会在任务之间回顾文件和 sessions,更新长期记忆,使下一次任务拥有前文背景。这个设计把 agent memory、文件状态和协作空间产品化,类似 Cursor cloud agents 和 Codex 类工具对环境持久性的强调。 查看原文
Cursor Cloud Agent Environment
Cursor 称 cloud agents 在其内部合并 PR 占比从去年 12 月的 10% 增长到 56%。配套文章的重点不是单个模型能力,而是 agent 的工作环境:云端机器、测试能力、环境自愈、与本地开发的一致性,以及面向 agent 的简化接口。Cursor 的结论是,开发环境成为 agent 用户的产品,环境质量直接决定长任务能否完成。 查看原文
Open Secure AI Alliance
Open Secure AI Alliance 由 NVIDIA 与成员公司推动,目标是用开放工具提升 AI 安全、漏洞披露和基础设施可信度。Cohere 宣布加入时强调,安全基础设施和可信模型能力应普遍可得。该联盟的出现与 agent 风险高度相关:当模型可以操作浏览器、文件系统、CLI 和企业工具时,安全工作需要共享检测、披露、隔离和响应机制。 查看原文
Scale AI Appoints Francis deSouza CEO
Scale AI 任命 Francis deSouza 为 CEO,8 月 10 日生效。官方公告称,公司近期在数据与应用业务均有增长,客户包括 BP、Mayo Clinic,并扩展了美国及国际政府业务。该任命反映 Scale 在 AI 产业链中的位置变化:从训练数据和评测供应商,继续向企业应用、政府合作和部署服务延伸。 查看原文
Databricks Free Edition Expansion
Databricks Free Edition 新增 Agent Bricks、Genie Code、Serverless GPUs、Lakebase 和 Lakeflow Designer,并称已有超过 50 万人使用免费版本。该组合让免费层覆盖 agent 构建、代码生成、GPU、数据库和数据流设计。对开发者生态而言,Databricks 正把数据平台入口扩展为端到端 AI 应用构建环境。 查看原文
LlamaIndex Parse Gateway
Parse Gateway 针对文档解析成本和准确率问题,逐页判断 PDF 复杂度,并根据页面类型与难度选择不同解析 tier。简单页面可本地免费解析,复杂页面进入更强 LlamaParse 能力;同时提供 MCP server,允许 agents 自行估计复杂度并做路由。它体现了 agent 工具链中的一个重要趋势:让 agent 在执行前做细粒度成本/质量决策。 查看原文