1/17 Runway × NVIDIA 实时视频生成
Runway 与 NVIDIA 在 GTC 联合发布实时视频生成预览,Gen-4.5 模型一天内从 Hopper 移植到 Vera Rubin NVL72,首帧延迟 <100ms。同时发布首个通用世界模型 GWM-1,可实时模拟物理环境用于机器人训练。
2/17 Anthropic 8.1 万人 AI 调研:最大担忧是幻觉和失业
Anthropic 用「Anthropic Interviewer」(Claude 驱动的大规模对话式访谈)调研 Claude 用户,一周收到 81,000 份回复,覆盖 159 国 70 种语言。用户最大收获是生产力提升(32%),最大担忧是不可靠/幻觉(27%)和失业(22%)。调研揭示「光影共存」现象——对 AI 情感支持感到兴奋的用户,担忧依赖性的概率是其他人的 3 倍。
3/17 Grok 4.20 Beta:幻觉率行业最低
xAI 发布 Grok 4.20 Beta 0309,在 Artificial Analysis AA-Omniscience 基准中幻觉率 22%(行业最低),健康领域准确率 94.4%,科学/数学 92.9%。多 Agent peer-review 机制可进一步将幻觉率压至 4.2%。Grok iOS 更名「Grok - AI Chat & Video」。
4/17 Google AI Studio Vibe Coding + Gemini API 更新
Logan Kilpatrick 预告 Google AI Studio 全新 vibe coding 体验(4 个月从零重建)。同日 Gemini API 更新:内置工具(搜索/地图/文件检索)支持 function calling,Gemini 3 支持 Google Maps grounding。
5/17 Mistral Small 4:128 专家 MoE 开源
Mistral Small 4 发布:128 专家 MoE,每 token 激活 4 专家(6.5B/119B),256K 上下文,Apache 2.0 开源。reasoning_effort 参数可调推理深度,统一指令/推理/多模态/编程四条产品线。延迟降 40%,吞吐 3 倍于 Small 3。
6/17 AI Slop 泛滥 + UNSLOP 工具应对
HuggingFace CEO Clement Delangue:大型开源仓库被 AI 垃圾 PR 淹没(每 3 分钟一个),GitHub 几乎不可用。同日 Matt Shumer 开源 UNSLOP,可自动批量检测并消除 AI slop 模式。
7/17 Karpathy 收到 Jensen 神秘硬件
Andrej Karpathy 在 GTC 收到 Jensen Huang 赠送的需 20 安培电力的设备,将用于开源项目 Dobby the House Elf。12.7K 赞,57 万浏览。
8/17 Perplexity Comet 登陆 iOS
Perplexity 旗下 AI 浏览器 Comet 正式上架 App Store。
9/17 Windsurf 定价全面改版
Windsurf 废弃双 credit 体系,简化为 Free/Pro($15)/Teams($30) + 新增 Max 计划,改用每日/每周配额制。
10/17 Cerebras CEO 回应 NVIDIA GTC
Cerebras CEO Andrew Feldman:NVIDIA GTC 最大公告是在推理加速上投 200 亿美元——这正是 Cerebras 6 年前已解决的问题。
11/17 LLM 37% 回复加剧用户妄想
Gary Marcus 引用研究:在聊天机器人相关妄想案例中,超 1/3 的 LLM 回复主动验证用户虚假信念(如确认不存在的疾病)。
12/17 Parallel:Agent 自主付费上网
前 Twitter CEO Parag Agrawal 的 Parallel 推出 MPP 协议,让 AI Agent 无需人工授权即可按 API 调用付费获取 Web 访问。
13/17 Solo Founder 两月 0→440 万美元 ARR
Linus Ekenstam 关注独立创始人 Ben 在不到两个月内从 0 增长到 440 万美元 ARR,称其有望成为首个十亿美元级 solo founder。46.8 万浏览。
14/17 Together AI 微调能力升级
Together Fine-tuning 新增 tool calling、推理、视觉语言模型微调,支持最高 1T 参数,MoE 架构吞吐量提升 6 倍。
15/17 Andrew Ng × Oracle:Agent 记忆课程
Andrew Ng 推出「Agent Memory: Building Memory-Aware Agents」,解决 Agent 跨 session 记忆丢失问题。
16/17 LangChain:开放 Agent 架构 + LangSmith Sandboxes
Harrison Chase 解析 Claude Code、OpenClaw、Manus 等 Agent 通用架构(Model + Runtime + Harness),演示用 LangChain + NVIDIA 开源复刻。同日 LangSmith Sandboxes 上线。
17/17 Databricks Lakebase GA
Azure Databricks 在 FabCon 2026 宣布 Lakebase(面向 AI Agent 的操作型数据库)正式 GA,同步更新 Lakeflow Connect 和 Genie。
Deep Dive 附录
Anthropic 81K 用户调研详情
方法:使用「Anthropic Interviewer」(Claude 驱动的对话式大规模访谈系统),覆盖 159 国、70 种语言,共 80,508 人参与。用户最大收获:生产力提升(32%)、认知伙伴关系(17.2%)、学习支持(9.9%)、技术能力拓展(8.7%)。用户最大期望:职业卓越(18.8%)、个人成长(13.7%)、生活管理(13.5%)、时间自由(11.1%)。用户最大担忧:不可靠/幻觉(26.7%)、失业(22.3%)、人类自主性丧失(21.9%)、认知退化(16.3%)。关键发现:「光影共存」现象——对 AI 情感支持感到兴奋的用户,担忧依赖性的概率是其他人的 3 倍;50% 用户认为节省了时间,但 19% 经历了「跑步机加速」效应。低收入国家对 AI 更乐观(视为机会阶梯),富裕国家更担忧失业和治理。全球整体正面情绪 67%。 查看原文
Runway GWM-1 世界模型
Gen-4.5(全球排名第一的视频生成模型)一天内从 Hopper 移植到 Vera Rubin NVL72,展示跨代硬件兼容。GWM-1 是 Runway 首个通用世界模型系列,实时模拟物理感知环境,应用于机器人训练、可探索虚拟世界和交互式虚拟角色。Vera Rubin 每 GPU 提供 50PF 推理算力。Runway CEO Cristóbal Valenzuela 表示 GWM-1 的目标是构建不仅生成像素、更能理解和模拟像素背后世界的模型。 查看原文
Grok 4.20 Beta 基准表现
Grok 4.20 Beta 0309(Reasoning 变体)在 AA-Omniscience 基准中幻觉率 22%(所有模型最低),该基准测试 311 个模型中的 26 个,覆盖 6,000 题目和 6 个经济相关领域。领域表现:健康 94.4%、科学/数学 92.9%、人文社科 86.3%、商业 84.8%、法律 73.8%、软件工程 69.9%。幻觉率排行:Grok 4.20 Beta 22%、Claude 4.5 Haiku 25%、Grok 3 mini 25%。 查看原文
Mistral Small 4 技术细节
架构:128 专家 MoE,每 token 激活 4 专家(6.5B 激活 / 119B 总参数),256K 上下文,支持 24+ 语言。核心创新:reasoning_effort 参数可调推理深度——”none” 模式快速响应(对标 Small 3.2),”high” 模式逐步推理(对标 Magistral)。合并此前 Mistral Small(指令)、Magistral(推理)、Pixtral(多模态)、Devstral(编程)四条产品线。性能:延迟降低 40%,吞吐量 3 倍于 Small 3。Apache 2.0 开源,支持 vLLM / Transformers / llama.cpp / LM Studio 部署。 查看原文