AI Frontier Daily / 2026.08.13

Grok 4.6 发布:同价升级,主攻知识工作与复杂任务

SpaceXAI 发布 Grok 4.6,称其相较 4.5 在复杂任务与知识工作上显著提升,同时保持原价。发布材料把 GDPVal-AA、AA-Briefcase、法律和编码代理任务列为重点;Elon Musk 随后开放一周双倍 token,并称模型登上 Databricks 对应榜单第一。多项领先结论目前主要来自发布方及其转述,仍需等待独立评测、稳定性和真实工作负载验证。

1/16 Grok 4.6 发布:同价升级,主攻知识工作与复杂任务

SpaceXAI 发布 Grok 4.6,称其相较 4.5 在复杂任务与知识工作上显著提升,同时保持原价。发布材料把 GDPVal-AA、AA-Briefcase、法律和编码代理任务列为重点;Elon Musk 随后开放一周双倍 token,并称模型登上 Databricks 对应榜单第一。多项领先结论目前主要来自发布方及其转述,仍需等待独立评测、稳定性和真实工作负载验证。

来源@cursor_ai@elonmusk12

2/16 Google 将手语转文本 SL2T 带入 Pixel 11

Google DeepMind 发布大规模多语言手语转文本模型 SL2T,率先为 Pixel 11 的 Gboard 与 Live Transcribe 提供 ASL 到英语输入。模型用超过 10 万小时、覆盖 50 多种手语的数据训练;设备端先提取身体姿态坐标,服务器只接收坐标序列完成翻译,以减少原始视频外传。Google 称其 FLEURS-ASL 零样本成绩达 70 BLEURT,产品设计由聋人社区与顾问委员会参与。

来源@GoogleDeepMind123@sundarpichai

3/16 Microsoft 首个自研推理模型 MAI-Thinking-1 上线 Foundry

Microsoft AI CEO Mustafa Suleyman 宣布 MAI-Thinking-1 已在 Microsoft Foundry 提供,并称这是团队从头训练的首个推理模型;Satya Nadella 随后转发确认。当天公开材料没有给出参数规模、上下文长度、价格、基准分数或与外部模型的对照,因此目前可以确认的是模型来源与平台可用性,而非其能力排名。这一发布继续扩大微软在合作伙伴模型之外的自研模型组合。

4/16 Cohere 开源 2.4B 视觉语言模型 North Micro Vision

Cohere 发布 24 亿参数 North Micro Vision,采用 Apache 2.0 许可,定位于复杂文档理解和边缘设备部署。模型支持原生分辨率处理、多轮图文对话、空间推理、视觉定位及多语言图像理解;官方称其在多项测试中超过 Gemma 4 E2B 与 Ministral 3 3B。生态侧已接入 NVIDIA AutoModel、Axolotl 与 MLX,便于在 GPU 或 Apple 设备微调运行;横向成绩仍待独立复现。

来源@cohere1234

5/16 Cerebras 云收入同比增 281%,签约 600 MW 容量

Cerebras 披露 2026 年第二季度进展:GAAP 云收入同比增长 281%,核心云收入增长 287%,快速推理云业务接近四倍;公司已签约 600 MW 数据中心容量,并计划年内把制造能力扩大超过 10 倍。合作项目包括为 OpenAI 的 GPT-5.6 Sol 提供服务,以及与 AMD 推进分离式推理。公告未在推文中给出收入绝对值、利润率或实际上线容量。

来源@cerebras12

6/16 Qwen3.8-Max 以 2.4T MoE 和 256K 上下文接入 Together AI

Together AI 上线 Qwen3.8-2.4T-A95B,披露模型总参数 2.4 万亿、激活参数 950 亿、上下文 256K,重点面向编码和长程代理任务,并支持任务状态、调度恢复、自测试、函数调用与结构化输出。阿里 Qwen 同日称 Qwen3.8-Max 在 Legal Research Bench 从第 22 升至第 4。Together 提供 day-zero serverless inference,但延迟、价格和独立评测仍需结合正式模型卡核对。

来源@togethercompute123@Alibaba_Qwen

7/16 ExtractBench 揭示长文档抽取“高精度、低召回”陷阱

LlamaIndex 发布 ExtractBench:370 份企业文档、4,869 页、8 个领域、67 种文档类型,共比较 14 个系统,并同时衡量准确率、长列表完整性、grounding 与成本。官方结果显示,短文档上多数系统接近,但超过 50 页后商用 VLM 召回率均低于 35%,容易返回少量正确行却漏掉大部分记录。发布推文称 Agentic Plus 长列表 F1 为 96.1%,当前网页榜单显示 94.4%,两者可能对应不同版本或口径。

来源@llama_index12

8/16 Suno 与 BMG 合作开发面向音乐行业的新模型

Suno 与大型音乐公司 BMG 宣布全球合作,并称这是即将发布的首个“与音乐行业共同开发”音乐模型的一部分。双方计划让自愿加入的艺术家与词曲作者参与新音乐体验,并探索新的经济机会;Suno 还将扩展面向独立音乐人的 In Session 与 Spark 项目。公告没有披露训练数据、授权范围、收入分配、模型发布时间或技术指标,当前重点是行业协作原则与 opt-in 机制。

来源@suno

9/16 Transformers.js 月下载量突破 1,000 万

Hugging Face CEO Clément Delangue 表示,团队开发三年的 Transformers.js 月下载量已超过 1,000 万,约为六个月前的 10 倍,并称其已成为浏览器内运行 AI 模型最流行的开源库。该增长反映本地推理对隐私、零服务端调用和计算资源分散化的吸引力;不过推文没有公开 npm 统计链接、活跃应用数、去重用户或实际推理负载,因此数字应按下载量而非用户规模理解。

10/16 Databricks 用“先检索再分类”处理十万级标签

Databricks 针对生物医学实体链接、供应商归一化和公司去重,比较纯向量检索、检索后 AI Classify、以及带提示缓存的前沿模型直调。其方案先召回少量候选标签,再让模型选择,避免把十万级 taxonomy 全部塞入上下文。公司称该流程在三个基准上比最佳成本效率型前沿模型平均准确率高 5 个百分点,token 成本约为百分之一;可迁移性仍取决于数据、模型和计价口径。

11/16 Groq 成为 NVIDIA Cloud Partner

Groq 加入 NVIDIA Cloud Partner 计划,获认证可按 NVIDIA 参考架构和运营标准设计、部署及运行加速计算基础设施。双方此前已有非独家推理技术许可和投资关系;新认证为 Groq 在现有数据中心加入 NVIDIA 推理硬件铺路。Groq 称其在北美、欧洲、中东与亚太运营数据中心,服务超过 600 万开发者并扩展到 200 MW 以上;这些规模数据来自公司公告。

12/16 Sakana Chat 加入 Fugu、Namazu 与完整代码执行

Sakana AI 更新免登录、免费使用的 Sakana Chat,由新一代 Fugu 和日语模型 Namazu 驱动,并加入完整代码执行。用户可用日语描述需求,在浏览器内生成互动网页、游戏和工具;办公场景可上传 Excel,让系统用 Python 分析、制图并整理报告。官方把儿童汉字与数学练习、小游戏及日本企业表格工作作为示例,当前未披露模型规模、沙箱权限、安全边界或任务成功率。

来源@SakanaAILabs123@hardmaru

13/16 Runway Agent 接入 Figma、Dropbox 与 Notion

Runway 为 Agent 增加 Figma、Dropbox 和 Notion 连接器,使设计、文件与文档可以直接同步到创作代理中,减少跨工具手工搬运;该功能面向所有付费方案。公司同日还上线 Grok Imagine Image 2.0,此前已接入 LTX-2.5。连接器公告没有说明写入权限、版本冲突、审计日志、数据保留或各平台支持的对象范围,企业使用仍需核对授权与治理细节。

来源@runwayml123

14/16 Pangram 检测样本显示 Claude 份额上升、Gemini 下降

Pangram 用内部表示上的线性探针识别模型家族,再统计匿名聚合的检测提交。其样本中 OpenAI 每月份额一直高于 50%,Anthropic 从 2024 年的 4.3% 升至 14.9%,Google 则从约 12% 降至 2026 年 7 月的 1.9%。但该分类器单样本 top-1 准确率为 91%,且数据来自主动提交给检测器的内容,不能代表全市场;与 OpenRouter 的绝对份额也明显不同。

15/16 Expedia 用 Keras 3 将排序推理延迟降低 70%

François Chollet 转述 Expedia 住宿排序栈升级:迁移到 Keras 3 后,训练速度提高 30%,推理延迟降低 70%。改造使用后端无关的 keras.ops,使现有层和模型未来可在 TensorFlow、PyTorch 或 JAX 间迁移,以利用不同优化内核。数据来自 Expedia 工程团队案例,未在推文中给出硬件、流量规模、模型结构、成本和端到端业务指标,因此不宜视为所有 Keras 迁移的通用收益。

来源@fchollet123

16/16 FLUX 3 进入 Luma,统一图像、视频、音频与动作预测

Luma 上线 Black Forest Labs 的 FLUX 3,称这是该系列首个覆盖图像、视频、音频和动作预测的通用模型,并已提供带原生音频的视频能力。当天公告只确认产品接入与能力范围,没有披露可用地区、分辨率、时长、价格、生成延迟、训练数据或跨模态评测。它体现视觉生成平台继续从单一图像或视频模型转向统一多模态创作入口,但实际一致性仍需使用验证。


Deep Dive 附录

Grok 4.6:知识工作定位与发布口径

SpaceXAI 将 Grok 4.6 定位为 4.5 的同价升级,强调困难任务、知识工作、法律与编码代理表现。发布材料及外部转述称其在 GDPVal-AA、AA-Briefcase 和法律评测领先,并登上 Databricks 对应榜单第一;公司成员称它兼具高速度、低成本与高能力。当前公开信息主要是发布图、管理层推文和早期用户评价,尚缺完整模型卡、统一评测设置、价格表和第三方复现,因此“领先”应限定在披露的榜单与发布时点。 查看原文

SL2T:从 50 多种手语数据到手机端输入

SL2T 在超过 10 万小时、50 多种手语的数据上训练,约四分之一数据来自 ASL。设备端用 MediaPipe Holistic 把手、身体和面部动作转换为姿态坐标,只把坐标传到服务器;模型直接从坐标序列生成文本,不依赖会损失非手部标记和空间结构的 gloss。Google 报告其在 FLEURS-ASL sd-test 上达到 70 BLEURT,并针对单手持机、不同签署速度和背景做了产品优化。项目由 Deaf Googlers、聋人合作伙伴和 AISLAC 参与治理,但 rare signs、快速手指拼写和复杂时态仍会出错。 查看原文

North Micro Vision:2.4B 文档视觉模型的本地生态

North Micro Vision 把原生分辨率图像、多轮图文、空间推理、视觉定位和多语言理解压进 2.4B 参数,并以 Apache 2.0 开放。Cohere 把复杂文档理解作为核心场景,称其在一组视觉理解、文档与 VQA 测试中超过 Gemma 4 E2B 和 Ministral 3 3B。模型已出现 NVIDIA AutoModel、Axolotl 与 MLX 路径,分别覆盖 NVIDIA GPU 适配、云端微调和 Apple 设备运行。公开权重降低了验证门槛,但不同量化、分辨率与文档长度下的准确率和内存占用仍需独立测量。 查看原文

Cerebras:近四倍云增长背后的容量扩张

Cerebras 的二季度公告给出 GAAP 云收入同比增长 281%、核心云收入增长 287%,并称已签约 600 MW 数据中心容量、2026 年制造能力将扩大超过 10 倍。业务侧包括为 OpenAI GPT-5.6 Sol 提供推理,以及与 AMD 合作分离式推理;这些安排显示公司正从专用晶圆级硬件向云服务和异构基础设施扩展。公告没有在摘要中提供收入绝对额、毛利、资本支出、已部署与签约容量拆分,因而更能说明增长方向,尚不足以独立判断业务规模和盈利质量。 查看原文

ExtractBench:为什么长文档会“看起来没错”却漏掉多数记录

ExtractBench 把值准确率、记录完整性、词级/页级 grounding 与成本放在同一框架,覆盖 370 份文档、4,869 页、8 个领域和 67 种类型。最困难的 long-list 场景包含 26,725 行无人认领财产、8,624 条债权人记录和 3,063 项 13F 持仓。当前博客显示,50 页以上商用 VLM 的召回率均低于 35%,但精度仍高,因此抽样检查容易误判为完整;编码代理较能保持准确率,却通常付出更高成本。发布推文的 96.1% 与当前网页榜单 94.4% 不一致,使用结果时应记录版本与评测日期。 查看原文 查看原文

Suno × BMG:把音乐行业参与写进模型发布前提

Suno 称与 BMG 的合作属于其首个“与音乐行业共同开发”模型的发布计划,双方将围绕自愿加入的艺术家和词曲作者设计创作体验与经济机会。Suno 还计划扩展每周写作营,以及为独立音乐人提供资源、导师和营销支持的 In Session、Spark 项目。公告强调 human creativity、opt-in 和责任原则,但没有公布哪些作品会进入训练、怎样撤回授权、收益如何计算、是否提供来源追踪或模型何时上线;后续合同与产品机制才是检验承诺的关键。 查看原文

十万级标签分类:检索先缩小候选,模型再决策

Databricks 的流程先从十万级 taxonomy 中用向量检索召回相关标签,再把候选集交给 AI Classify,避免完整标签集合超过上下文并降低调用成本。三个测试场景涵盖生物医学实体链接、供应商归一化和公司去重;公司报告其平均准确率比最佳成本效率型前沿模型高 5 个百分点,token 成本约为百分之一。方案把传统检索的高召回与模型语义判断结合,但结果受候选召回率、标签描述质量、长尾分布、缓存策略和供应商定价影响,部署时仍需用自身数据重跑。 查看原文

Pangram 的模型份额为何不能直接代表全市场

Pangram 用其检测器内部表示训练线性探针识别模型家族,单样本 top-1 准确率约 91%,再按月聚合用户提交的匿名文本。数据中 OpenAI 长期高于 50%,Anthropic 从 4.3% 增至 14.9%,Google 到 2026 年 7 月降至 1.9%;与 OpenRouter 对照时,两者都显示 Google 流量下降,但绝对份额不同。Pangram 样本偏向需要检测 AI 文本的用户,OpenRouter 偏向研究者和技术调用者,模型直连流量又可能缺失。因此这些曲线适合描述各自平台的趋势,不能当作消费者或 API 全市场份额。 查看原文