1/14 OpenAI 将 Codex 带入 ChatGPT 移动端
OpenAI 宣布 Codex now in preview in the ChatGPT mobile app,iOS 和 Android 支持地区用户可在手机里启动新任务、查看输出、调整执行方向并批准下一步,Codex 则继续在 laptop、Mac mini 或 devbox 上运行。Sam Altman 和 Greg Brockman 也转发强调“wherever you have it running”。这把 coding agent 从桌面 IDE/终端工具扩展成可远程监督的持续工作流:开发者不一定要守在主机前,长任务、review、approve 和 steer 可以变成移动端控制面。Windows host 连接仍在后续计划中。
2/14 xAI 发布 Grok Build agentic CLI 早期 beta
xAI 宣布 Grok Build early beta,定位为用于 coding、building apps 和 automating workflows 的 agentic CLI,当前面向 SuperGrok Heavy 用户开放。Elon Musk 连续转发试用反馈,并称“Try this early Grok Build beta”。这意味着主流 frontier labs 的 coding-agent 竞争继续向本地终端、repo 内执行和长程任务推进:OpenAI 有 Codex,Anthropic 有 Claude Code,Kimi 有 Code/WebBridge,xAI 现在用 Grok Build 切入。短期看,订阅层级、安装体验、repo 权限和模型反馈闭环会成为差异点。
3/14 Kimi Web Bridge 把本地 coding agents 接到浏览器
Kimi Moonshot 发布 Kimi Web Bridge:一个浏览器扩展,让 agent 像人一样 search、scroll、click、type 并完成网页任务。官方 thread 展示了自动创建 Google Form、跨平台搜索并填入 spreadsheet、复制网站、多模态网页理解,以及把日常流程学习成 reusable skills。Kimi 明确列出支持 Kimi Code CLI、Claude Code、Cursor、Codex、Hermes 等工具。这个方向把 browser-use 能力从单独的网页自动化库推入 coding-agent 工作台,未来 agent 写代码、调网页、填 SaaS 表单和收集数据会更紧密地连在一起。
4/14 Anthropic 与 Gates Foundation 投入 2 亿美元做 AI 公益部署
Anthropic 宣布与 Gates Foundation 建立四年、2 亿美元合作,覆盖 grant funding、Claude credits 和 technical support,面向 global health、life sciences、education、agriculture、economic mobility 等领域。Anthropic 称这属于 Beneficial Deployments 工作,重点是在市场激励不足的地方提供 AI 工具、公共数据集、评测 benchmark 和工程支持。这个合作说明 frontier labs 的竞争不只在模型和企业收入,也在“谁能把 AI 交付到公共部门和低资源场景”:credits、技术支持、机构合作和可验证影响会越来越重要。
5/14 Anthropic 发布 2028 AI leadership 情景论文
Anthropic 发布关于 US-China AI competition 的新论文,称美国及民主盟友在 frontier AI 仍处领先,但保持领先需要 trusted hardware、frontier models、export-control enforcement、国际采用和防范 distillation 风险共同发挥作用。论文用 2028 年两个情景讨论民主国家是否能设定 AI 标准,还是让强大 authoritarian systems 获得 frontier AI。它延续 Anthropic 近期更强的地缘政治表达:AI 安全、模型访问、芯片控制、开源/开放生态和国家能力正在被放在同一个战略框架里。
6/14 Datadog Toto 2.0 让 time-series foundation models 进入 scaling 讨论
Clement Delangue 转发 Datadog Toto 2.0:五个 Apache-2.0 open-weight time-series foundation models,从 4M 到 2.5B 参数,Datadog 称 every size beats the last,并在 BOOM、GIFT-Eval 和 TIME 上取得领先结果。Datadog 的博客进一步强调 Toto 2.0 在参数效率和 inference latency 上相对 Toto 1.0 有明显提升。这个发布重要之处在于把 scaling laws 从语言/视觉扩展到 observability metrics 和时间序列预测:如果 TSFM 的质量随参数和数据稳定提升,企业监控、需求预测和异常分析会出现更通用的 foundation layer。
7/14 LangSmith LLM Gateway 把 agent governance 前移到运行时
Harrison Chase 转发 LangChain 在 Interrupt 的多项发布,其中 LangSmith LLM Gateway 最关键:它位于 agent 与 LLM providers 之间,在请求离开环境前执行 spend limits、PII/secrets redaction、policy enforcement,并把事件接回 LangSmith traces。LangChain 同时强调 Context Hub、Messages View、Fleet free model 和 LangChain Labs/continual learning。agent 平台正在从“可观测”走向“可执行治理”:只记录 runaway loop 或敏感数据泄漏已经不够,企业需要在调用发生前阻断、降级、计费和审计。
8/14 Perplexity Computer 接入 Snowflake,agentic analytics 继续贴近数据仓库
Perplexity 宣布 Computer now connects to Snowflake,可以基于 live warehouse data 运行端到端分析,返回 SQL、source tables、filters、metrics,并构建 dashboards 和 automations。官方强调 admin 仍能控制 access、business definitions 和 shared data logic。这个更新把通用 agent 的竞争推向企业数据层:真正可用的数据 agent 不是随便生成 SQL,而是要理解 warehouse 语义、保留 lineage、展示来源、继承权限并可被业务用户反复追问。Snowflake、Databricks、BI 和 agent 产品的边界正在进一步重叠。
9/14 Together AI 与 Rime 把语音 agent 基础设施做成低延迟产品面
Together AI 宣布 Rime Mist v3 上线,面向 enterprise voice agents 提供 deterministic pronunciation、controllable voice output、SSML、专有名词/医疗术语发音控制,并有英文和多语言 endpoints。同日 Together 还称其 STT 模型在 Artificial Analysis Speech to Text leaderboard 占据速度前两名,NVIDIA Parakeet TDT 0.6B V3 可达到每秒处理 303 秒音频,价格为每 1000 分钟 1.50 美元。voice agents 的瓶颈正在从“能说话”转向端到端 latency、发音一致性、部署形态和成本。
10/14 AI21 讨论 stochastic agents 的 cache key 设计
AI21 Labs 用 5 条 thread 解释 agent eval 中的缓存问题:LLM 输出带随机性,best-of-N 等 parallel rollout 策略会让“same input, same output”的 deterministic assumption 失效。如果 cache key 绑定 execution order,parallel branches 完成顺序变化就会污染 prompt-response pairing;AI21 的修复是编码 graph position,并把 experiment name 和 component code 分开。这个细节很工程化,但很关键:agent 实验要同时做 A/B test、best-of-N、ensemble 和成本控制,缓存若设计不对,评测结果和成本估算都会被扭曲。
11/14 NVIDIA OpenShell v0.0.41 强化 agent policy 和 sandbox 控制
NVIDIAAI 发布 OpenShell v0.0.41,加入 agent-driven policy management、CLI sandbox resource flags、OIDC TLS custom CA support、workspace-boundary checks for sandbox downloads,以及稳定性修复。OpenShell 之前被 NVIDIA 定义为 autonomous agents 的安全运行层,包含 sandbox、policy engine 和 privacy router。这个更新虽然底层,但对应企业 agent 真实需求:agent 不只会改文件和跑命令,还会下载、访问网络、调用内部服务并持有凭证;policy、resource limits、TLS trust、download boundary 和 auditability 决定它能否进入生产。
12/14 Runway 在日本开设东京办公室并投入 4000 万美元
Runway 宣布扩展日本业务:开设 Tokyo office,并在当地投入 initial $40M。Runway 称日本已是其最大、增长最快的市场之一,过去 12 个月 enterprise customer base tripled,并成为全球第三大市场;Yamaha、NHN、SoftBank 等公司正在 marketing、advertising 和 creative content 中采用 Runway。AI 视频公司的竞争正在从模型 demo 转向地区销售、企业客户和本地行业合作。日本的 gaming、media、robotics 和广告生态给 Runway 提供了把生成式视频变成生产工具的明确场景。
13/14 开发者生产力争论从“代码量 10x”转向净价值
François Chollet 表示,开发者 shipping code 的数量大约 10x,但 net developer productivity 只小幅提升甚至没有明显提升;新增代码一部分解决更细碎的问题,另一部分也制造了新的问题。他把这类现象类比早期 computerization:能执行的工作量暴涨,但达到同样高层结果所需的工作也随之膨胀。Matt Shumer 同日提醒,给人读的内容可以用 HTML,但 agent consuming content 时 Markdown 往往更优。随着 coding agents 普及,行业会更关注代码价值、维护成本、agent 可读格式和工作流净效率。
14/14 学习、模型生态和 agent 安全继续围绕基础能力补课
Andrew Ng 发布 Transformers in Practice 课程,与 AMD 合作讲解 transformer 如何逐 token 生成、attention/layers 如何影响预测、量化如何加速 GPU inference,以及 hallucination、RAG、chain-of-thought 对输出的影响。Ethan Mollick 则继续强调 thinking tokens 对 hacking、math、science 等任务的 scaling 作用,并转发“Whimsey attacks”对 agent guardrails 的影响。Gary Marcus 提到 2025 年有 140,000 fake citations。今天这些讨论共同指向一个现实:模型/agent 应用扩散很快,但理解推理机制、控制成本、降低幻觉和加固 guardrails 仍是基础课。
Deep Dive 附录
OpenAI Codex mobile
OpenAI 的官方说明确认 Codex 在 ChatGPT mobile app 中进入 preview,覆盖 iOS 和 Android 的支持地区,并面向所有计划逐步推出。用户可以在手机上启动任务、查看 agent 输出、调整方向并批准下一步,主机端 Codex 继续在 laptop、Mac mini 或 devbox 上运行。这个能力把 coding agent 的控制面和执行面分离:手机负责监督和决策,开发机负责长程执行。Windows 连接仍在路线上。 查看原文
xAI Grok Build
xAI 的 Grok Build early beta 是一个直接运行在 terminal 中的 coding agent 和 CLI,面向 professional software engineering 与 complex coding work。当前访问权限绑定 SuperGrok Heavy,安装命令由 x.ai 提供。它的战略意义大于单个 CLI:xAI 正把 Grok 从聊天/搜索/社交入口推进到开发者工作流,与 Codex、Claude Code、Cursor、Kimi Code 等产品竞争本地 repo 执行、自动化和长任务反馈闭环。 查看原文
Anthropic x Gates Foundation
Anthropic 与 Gates Foundation 的四年 2 亿美元合作由 grant funding、Claude usage credits 和技术支持组成,目标场景包括 global health、life sciences、education、agriculture 和 economic mobility。Anthropic 的 Beneficial Deployments 团队会提供 Claude credits、engineering support、public health datasets、evaluation benchmarks 和 discounted access。重点是让 AI 工具进入正常商业市场覆盖不足的公共利益场景。 查看原文
Anthropic 2028 AI leadership
Anthropic 的 2028 scenario paper 把 AI competition 明确放进 US-China 和民主盟友框架,认为美国及盟友今天拥有 frontier lead,但需要在 compute、trusted hardware/models、出口管制执行、防范 distillation、国际采用和安全治理上持续行动。论文的核心不是单一模型能力,而是“谁设定 AI 时代的技术与治理标准”。它也说明 frontier labs 正越来越主动参与国家战略叙事。 查看原文
Kimi WebBridge
Kimi WebBridge 是一个把 local agents 与浏览器扩展连接起来的工具。官方帮助页列出 Chrome/Edge 安装方式,并说明可与 Claude Code、Codex、Cursor、Kimi Code、Hermes 等本地 agent 配对。推文展示了网页搜索、表单创建、网站复制、spreadsheet 填充和 workflow skill 化。它代表 browser automation 正成为 coding-agent 标配能力,而不是独立产品线。 查看原文
Datadog Toto 2.0
Datadog Toto 2.0 覆盖 4M、22M、313M、1B、2.5B 五个 open-weight time-series foundation models,并以 Apache 2.0 发布。Datadog 称每个尺寸都优于更小尺寸,在 BOOM、GIFT-Eval、TIME 等 benchmark 上领先,并相对 Toto 1.0 有约 7x 参数效率提升。Toto 2.0 还通过 contiguous patch masking 让预测可单次 forward pass 完成,从而改善长 horizon inference latency。 查看原文
LangSmith LLM Gateway
LangSmith LLM Gateway 是一个 runtime governance layer,部署在 agents 和 LLM providers 之间。它提供 hard spend caps、real-time cost rollups、PII/secrets redaction、layered policy enforcement、admin audit logging,并把 policy events 写回 LangSmith traces。这个设计把治理从“事后看日志”前移到“调用前拦截”。对企业 agent 来说,成本失控和敏感数据外泄都需要在 request layer 解决。 查看原文
Perplexity Computer Snowflake
Perplexity 的 Snowflake 连接让 Computer 可以对 live warehouse data 执行分析、生成 SQL、展示 source tables、filters、metrics,并构建 dashboards 和 automations。其 Data Map 文档说明,Computer 会为 Snowflake/Databricks 生成数据地图,记录关键表、字段、常见 query patterns 和关系,并可从用户反馈与 admin edits 中改进。agentic analytics 的核心是语义层、权限和可追溯性。 查看原文
Rime Mist v3 on Together AI
Rime Mist v3 面向 enterprise TTS,强调低延迟、确定性发音和 cloud/on-prem 部署。Together AI 的发布把 Mist v3 放到其 dedicated infrastructure 上,并提供英文和多语言 endpoints、brand names/medical terms/domain vocabulary 发音控制、SSML pause/speed control。Together 同日还强调高速 STT 模型,对实时 voice agents 来说,STT、reasoning、TTS 三段 latency 都会决定产品体验。 查看原文 查看原文
AI21 agent cache design
AI21 的 thread 把 agent eval 中的缓存问题说得很具体:LLM stochasticity 与 best-of-N parallel rollouts 会破坏“同输入同输出”的缓存假设。正确的 cache key 需要识别 graph position,而不是执行完成顺序;experiment name 控制 key,component code 控制 prompt。它与 AI21 Maestro 的 agent optimization 方法相呼应:生产 agent 需要在准确率、成本、延迟、缓存、重试和评测器可靠性之间做系统化实验。 查看原文 查看原文