1/15 GPT-5.5 发布一周,OpenAI 称其成为最强模型发布
OpenAI 表示 GPT-5.5 发布一周后已成为公司最强模型发布,API 收入增长速度超过以往任何版本的 2 倍,Codex 收入也在不到 7 天内翻倍,主要需求来自企业级 agentic coding 工具。当天 OpenAI 还推广 Codex 迁移能力,称用户可把设置、插件、agents 与项目配置导入 Codex app 和 CLI,以减少切换成本。Sam Altman 同步淡化“Codex vs Claude Code”的工具对立,称用户应选择最适合自己的工具。
2/15 Codex 继续从编码助手扩展成工作流入口
Greg Brockman 多条推文把 Codex 描述为“everything productivity app”,并展示 Codex 内置 Ralph loop++、小任务自动化和 /pet 互动等新能力。Sam Altman 也提到 Codex pets 虽不是最重要功能,但实际有用且可以尝试孵化。OpenAI 的产品信息显示,Codex 不只在模型发布后承接编码需求,还在向更完整的工程工作台迁移:设置导入、插件导入、项目配置和轻量交互能力共同降低持续使用门槛。
3/15 xAI API 上线 Voice Cloning,语音能力进入开发者接口
xAI 宣布 Voice Cloning 已通过 xAI API 上线。开发者可以在不到 2 分钟内创建自定义声音,也可以从覆盖 28 种语言的 80 多个预设声音中选择,用于个性化 voice agents、有声书、游戏角色和其他音频场景。这是 xAI 将 Grok 生态从聊天、图像/视频体验扩展到可编程语音生成的重要一步。Elon Musk 同日继续推广 Grok Imagine agent mode beta 和 Grok 4.3,显示 xAI 正在把模型能力包装成多模态开发接口。
4/15 Microsoft Agent 365 GA,把企业治理系统延伸到 AI agents
Satya Nadella 宣布 Agent 365 正式 GA,定位是把企业已使用的身份、安全、治理和管理系统扩展到每一个 AI agent 及其交互。这个发布把 agent 从“单个工具能力”推进到企业控制平面的管理对象:企业需要知道有哪些 agent、它们可访问什么、如何审计交互、如何应用安全策略,以及如何与现有 Microsoft 生态集成。相比单纯模型接入,Agent 365 更强调组织级部署、权限边界和生命周期治理。
5/15 Qwen 与 Fireworks 合作,强化闭源权重模型的生产部署通道
Qwen 宣布与 Fireworks AI 达成战略合作,在 Fireworks 平台提供 Qwen family closed-weights models 的优化生产部署。官方称合作目标包括更低延迟、更低微调和推理成本、企业级可靠性、安全性和可扩展性,以及更容易接入现代 AI 工作流。该信息反映出中国模型生态正在加强海外开发者分发与推理基础设施合作:模型本身之外,低延迟、稳定托管和企业部署体验成为竞争重点。
6/15 NVIDIA 用 speculative decoding 加速 RL 后训练 rollout
NVIDIA Research 发布 NeMo-RL + vLLM 的 speculative decoding 研究,目标是缓解 RL post-training 的 rollout bottleneck。推文称该方法可在 8B 模型上带来 1.8 倍更高吞吐,并在 235B 规模上预计带来 2.5 倍端到端加速。核心意义在于,前沿模型后训练的瓶颈不只是算法和数据,也包括生成样本的工程效率;如果 rollout 能无损加速,同样算力下可进行更多策略更新和实验迭代。
7/15 NVIDIA OpenShell 聚焦企业 agent 安全沙箱
NVIDIA 宣布 OpenShell 用于让企业 AI agents “secure by design”。官方称这是一个开源安全沙箱,可控制 agent 能访问、共享和发送的内容,方便企业采用并审计。随着 agent 开始自动浏览网页、调用工具、读写文件和触发外部操作,安全问题从模型输出本身扩展到运行时权限、数据外泄和动作边界。OpenShell 的定位正是把 agent 执行环境变成可治理的基础设施,而不是把所有风险压给提示词。
8/15 Pika 推 Claude MCP 插件,把创意视频变成 agent workspace 技能
Pika 宣布与 Claude MCP 集成,并发布 Pika Plugin,首批提供 Podcast Video、Explainer 和 UGC Ad 三个 Skills。官方展示的用法不是单独打开视频生成器,而是在 Claude 项目里直接把代码项目、GitHub 链接或营销需求转成宣传视频、播客视频和广告素材。安装说明要求用户连接 Pika MCP,并在 Claude 的插件/自定义流程中添加 Pika-Labs/Pika-Plugins。创意工具正在从独立编辑器变成 agent 可调用的工作流模块。
9/15 ARC-AGI-3 显示最新前沿模型仍低于 1%
Francois Chollet 指出最新一批模型在 ARC-AGI-3 上仍低于 1%,并转发详细博客分析 GPT-5.5 和 Opus 4.7 等模型的失败模式。该基准关注模型在陌生视觉规则和程序化任务结构下的泛化能力,而不是熟悉题型上的语言或代码熟练度。今天的讨论提醒行业:即使模型在编码、工具使用和多模态生成上快速进步,面对新任务结构时的系统性失败仍是 AGI 争论中的关键证据。
10/15 Agent 栈的重心从框架抽象转向企业上下文数据层
LlamaIndex 转发 VentureBeat 采访,CEO Jerry Liu 称 LLM stack 中真正留下来的不是 2023 年节省开发时间的框架抽象,而是数据层,因为 Codex、Claude Code 等 agent 都需要上下文,企业最有价值的上下文仍锁在 PDF、合同和 filings 等文件格式中。Harrison Chase 同日也提到模型变强后,能浏览网页的 agents 会成为重要趋势。两条信息指向同一结论:agent 产品竞争会越来越依赖可检索、可授权、可更新的上下文管道。
11/15 Replit 十周年开放 24 小时免费 Agent,继续争夺 vibe coding 入口
Replit 宣布 5 月 2 日所有用户可免费使用 Replit Agent 24 小时,并配合十周年活动举办 buildathon。官方文案强调“10 years of Replit, one day of free vibe coding for everyone”,让用户在一天内免费构建任何项目。该动作既是品牌周年活动,也是用户增长实验:当 Codex、Claude Code、Cursor、Windsurf 等工具争夺开发者工作流时,Replit 用浏览器内完整构建环境和免费窗口吸引新用户尝试 agentic app platform。
12/15 Runway 登陆 Android/iOS,Luma 继续推广 campaign agents
Runway 宣布产品已同时登陆 Android 和 iOS,文案强调用户可在任何设备、任何地点创作。Luma Labs 则继续推广 Luma Agents,把营销活动简报、受众和视觉方向转成 campaign visuals。两家公司都在把生成式视频和图像能力从“桌面创作工具”推向更随手的生产工作流:Runway 通过移动端扩大入口,Luma 通过 agent 化简报流程降低商业素材生产门槛。创意 AI 的竞争正在从单次生成质量转向跨设备和跨任务的连续工作流。
13/15 本地 Chrome agent 示例展示 WebGPU 小模型工具调用路线
AlphaSignal 总结一个可在 Chrome 内本地运行的 AI agent:无服务器、数据不离开设备,使用 Gemma 4 E2B 这样的 2B 模型和原生工具调用模板,通过 WebGPU 加速。该扩展可语义搜索浏览历史、读取和总结网页、打开/关闭/切换标签页,并高亮屏幕元素;架构上由后台脚本一次性加载权重,side panel 保持聊天,content scripts 处理 DOM 访问,页面内容用 all-MiniLM-L6-v2 嵌入后存入 IndexedDB。它展示了小模型本地 agent 的可行产品形态。
14/15 Agents 被视为 AI 基建需求从泡沫转向短缺的解释变量
Ethan Mollick 转发 The Atlantic 文章,认为其解释了为什么市场叙事在不到半年内从“AI 是泡沫”转向“数据中心不够用”,关键变量是 agents。他同日还指出,组织本身已经是超人类智能体,AI 作为个人生产力工具会遇到自然上限,许多收益依赖和企业系统整合。两条观点合在一起说明,行业对算力和软件的预期正在从“个人聊天机器人效率提升”转向“组织级 agent 工作流”,这也解释了企业基建投入继续升温。
15/15 开源与高性价比模型继续挤压闭源 API 成本叙事
Bindu Reddy 称 Kimi 2.6 和 GLM 5.1 的性能已非常接近闭源 AI,主要问题是速度,并表示公司正在把所有 batch jobs 转向开源模型,以降低闭源 API 成本。她还强调 DeepSeek V4 Flash 是被低估的快速开源模型,适合大规模简单用例。Swyx 则基于 Artificial Analysis 数据称 Grok 4.30 在 frontier models 中具备较高 intelligence per dollar。今天的多条推文显示,模型选型正在从“谁最强”细化到延迟、批处理成本、任务复杂度和单位智能价格。
Deep Dive 附录
xAI Voice Cloning API
xAI 宣布 custom voice cloning 已进入 xAI API。开发者可在不到 2 分钟内创建自定义声音,也可从 80 多个预设声音中选择,覆盖 28 种语言。官方列举的场景包括 voice agents、有声书、游戏角色和个性化音频产品。它把 xAI 的开发者接口从文本和多模态交互进一步扩展到可编程语音生成,对需要品牌音色、角色声音或多语言语音代理的应用尤其直接。 查看原文
Microsoft Agent 365 GA
Microsoft Agent 365 正式 GA。Satya Nadella 的发布信息强调,企业已用于身份、安全、治理和管理的系统需要扩展到 AI agents 及其交互。Microsoft 安全博客将其定位为企业 agent 控制平面,用于注册、管理、保护和审计组织内的 agents。该方向说明 agent 部署的核心问题正在从“能否完成任务”转向“谁创建、谁授权、能访问什么、如何审计以及如何防止越权操作”。 查看原文
NVIDIA RL speculative decoding
NVIDIA Research 的论文聚焦 RL 后训练中的 rollout 生成瓶颈。方法使用 speculative decoding:先由较快 draft model 提出候选 tokens,再由目标模型验证,从而保持目标模型输出分布不变。NVIDIA 称在 8B 模型上吞吐提高 1.8 倍,并预计在 235B 规模达到 2.5 倍端到端加速。对大模型训练团队而言,这类工程优化可直接提高实验周转速度和单位算力产出。 查看原文
ARC-AGI-3 GPT-5.5 与 Opus 4.7 分析
ARC Prize 发布博客分析 GPT-5.5、Opus 4.7 等前沿模型在 ARC-AGI-3 上的失败模式。Francois Chollet 强调最新模型整体仍低于 1%。ARC-AGI-3 关注模型能否在陌生规则系统中归纳任务结构,而不是复现训练中常见模式。这个结果给当前“模型在编码和工具使用上快速提升”的叙事加入约束:强任务能力不等于可靠的跨分布泛化。 查看原文
Pika Claude MCP Plugin
Pika 发布 Claude MCP 集成和 Pika Plugin,首批 skills 包括 Podcast Video、Explainer 和 UGC Ad。安装流程通过 Claude 的插件/自定义入口添加 Pika-Labs/Pika-Plugins,并连接 Pika MCP。其意义在于创意视频生成正在被封装成 agent workspace 中可调用的技能:用户可以让 Claude 在构建项目的同时生成解释视频、播客视频或广告素材,把产品开发和发布传播放进同一工作流。 查看原文