1/13 Meta 发布 Muse Image,并预览 Muse Video
Meta AI 发布 Meta Superintelligence Labs 的首批媒体生成模型 Muse Image 和 Muse Video。Muse Image 被定位为 agentic image model:它不仅按提示生成图片,还能调用工具、自我修正、组合多张参考图、利用 Instagram 社交上下文,并通过 Muse Spark 协作生成网页和可交互视觉内容。Meta 还强调 Muse Image 的 test-time compute scaling,称模型会在文本和视觉 token 上进行推理与工具执行,效果优于普通 Best-of-N 采样。Muse Video 则是同一预训练底座上的早期视频预览,支持 native audio,但 Meta 也承认音画同步和高速物理运动仍是改进方向。
2/13 Gemini API Managed Agents 增加后台任务、远程 MCP 和凭证刷新
Google 的 Logan Kilpatrick 宣布 Gemini API Managed Agents 更新,核心能力包括 background tasks、remote MCP and function calling、network credential refresh,并开放 free tier 入门。官方表述的目标是降低把强 agent 放进生产环境的成本、摩擦和复杂度。后续路线还包括新的 UI experience 和 Google 构建的 customer agents。相比单次 demo,这类托管 agent API 的竞争点转向长期后台执行、外部工具协议、网络凭证生命周期和生产成本控制,说明 agent 平台正在从“会操作”进入“可托管、可计费、可恢复”的基础设施阶段。
3/13 Google DeepMind 把 Gemini 接入古文字专家模型
Google DeepMind 发布 Predicting the Past Skill,用 Google Antigravity 把 Gemini 接入 Aeneas 和 Ithaca 等古文字专家模型,让历史学家用自然语言研究 Greek 和 Latin texts。官方列出的挑战包括为每条铭文创建定制分析和可视化、跨来源映射大规模模式、以及让非编程用户调用高级 AI 工具。这个方向不是通用聊天机器人替代历史学家,而是把 Gemini 的推理界面和领域模型结合成可协作 research workflow。它也说明 “AI skill” 正在从办公自动化扩展到小众但高价值的学术工具链。
4/13 FireSat 新增 3 颗卫星,推进 20 分钟级 wildfire updates
Sundar Pichai 宣布 FireSat 首颗卫星入轨一年内已经发现现有卫星看不到的野火;当天又有 3 颗卫星加入星座,使 FireSat 更接近每 20 分钟提供近实时 wildfire updates 的目标。FireSat 是 Google Research、Earth Fire Alliance、Muon Space、Moore Foundation、Bezos Earth Fund 和 SpaceX 等合作的项目,用卫星观测和 AI 识别早期野火。相比纯模型能力展示,这类项目的关键是把 AI 放进完整传感网络、轨道部署和应急响应系统中,衡量指标也从 benchmark 转向发现速度、覆盖频率和实际公共安全价值。
5/13 Databricks 把 enterprise agent 重点放到数据工程和会话级治理
Databricks 连续发布 Genie Code、Omnigent 和 Lakeflow 更新,主题都指向 enterprise agent 的生产底座。Genie Code 增加全页 command center、多线程任务、review points、instructions、skills、connectors,以及对 MLflow、Model Serving 和 compute 的原生理解;后续 scheduled tasks 会让它自主运行并交回结果。Omnigent 的 contextual policies 则把治理从单步 allow/deny 扩展到 session state,可做预算、动态风险评分和最小权限控制。Lakeflow 更新强调统一 ingestion、transformation、orchestration 和 Unity Catalog 治理,说明企业 agent 的瓶颈越来越多落在数据基础和控制面。
6/13 Sakana 转发 Lilian Weng:RSI 的现实入口可能是 harness engineering
Sakana AI 推荐 Lilian Weng 关于 recursive self-improvement 的长文,认为从模型外围的 harness 入手,比直接修改权重更像近期可行路径。文章把 RSI 拆到 prompts、tools、memory、evals、trace mining、scaffolds 和 execution environment 等系统层,并讨论评价困难、diversity collapse、reward hacking 等风险。Sakana 同时指出自己的 The AI Scientist、ShinkaEvolve 和 Darwin Godel Machine 都是相关案例:自动研究流水线、LLM program evolution、以及 agent 改写自身 harness code。这个讨论把“AI 自我改进”从抽象奇点叙事拉回工程闭环、数据挖掘和安全边界。
7/13 NVIDIA MOTIVE 用数据归因挑选真正改善视频运动的训练片段
NVIDIA AI 介绍 ICML 2026 Outstanding Paper Honorable Mention 论文 MOTIVE,用 motion-centric gradient attribution 判断哪些 fine-tuning clips 会改善或损害视频模型的 temporal dynamics。方法不是泛泛选择好看视频,而是把训练信号偏向移动区域、降低静态背景权重,再按 clip 对运动质量的贡献评分。NVIDIA 称用高影响片段微调可提升 VBench dynamics,并在人工偏好中以 74.1% 胜过 base model。对视频生成来说,这说明训练数据竞争正在从规模和清洗进入“哪类 clip 对哪种能力真正有因果贡献”的 attribution-aware 阶段。
8/13 LangChain 讨论 deep agents、LLM Wikis 和 agent trace 标准化
Harrison Chase 推广 deepagents,称这是 LangChain 最新的 open source、model-agnostic agent harness,并配套推出 LangChain Academy 课程。他同时继续讨论 LLM Wikis,认为 repo 或领域 wiki 正成为 agent memory 的一种未来形态,能让 coding agent 在长任务中获得稳定上下文,而不是只依赖短 prompt 或临时检索。当天他还询问 ATIF 是否已在生产 agent runtime 中被标准化,或者生态仍是各自为政。这个方向显示 agent 工程正在把注意力从模型选择转到 harness、memory、trace format、evals 和可复用上下文层。
9/13 Replit 把“vibe coding”产物包装成职业履历和创业入口
Replit 发布 Community Profiles,称每个用户发布的 app 都可以成为 proof of work,并集中展示在可定制 profile 中,配合 activity、Power Ranking 和分享机制。随后 Replit 又宣布与 Ramp 合作,让 business builders 可以直接从 Replit Agent 触发 incorporation、banking、cards 和 bills。两条消息合在一起看,Replit 正在把 agent coding 从开发体验扩展到职业展示和公司创建流程:用户不只是生成代码,还把项目、信用、排名、商业账户和支付流程连在一个 builder workflow 里。
10/13 Fable 5 继续展示 agentic creation,也暴露 AI 文案风格问题
Ethan Mollick 展示用 Fable 构建 procedural fantasy kingdom generator,包含经济、贸易路线、人口、战争、血统和随机事件;他此前也持续测试 Fable/world models 生成游戏和模拟。Bindu Reddy 则宣传 Abacus AI agent 可用 Fable 5 Max Mode 构建复杂 SaaS、workflow、移动应用和常驻服务器。与此同时,Mollick 提醒 Fable 在软件和设计项目中会把夸张、模板化的 AI 文案带进 toast、menu 等细节,而且很难完全清除。agentic creation 的边界在外扩,但产品化仍需要处理审美、文案、默认模式和后续人工编辑成本。
11/13 开源权重供给、主权 AI 和中美模型竞争再度升温
Ethan Mollick 认为 frontier open weights model 的持续流动可能不会无限延续,甚至不会持续很久;这直接影响各国 sovereign AI strategy,因为很多策略假设开放权重会持续接近前沿,并以较小性能损失换取成本、隐私和控制。Clement Delangue 则呼吁 Elon Musk 和 Cursor 开源模型,认为这会是美国缩小开源差距的直接贡献。Bindu Reddy 从另一侧指出,组织正在采用 hybrid setup:frontier models 做 planning,open-weight models 做简单任务。围绕开放模型的讨论正在从意识形态转向供应链、地缘竞争、推理成本和任务路由。
12/13 AI 使用研究和经济质疑把焦点拉回真实成本与真实用户
Ethan Mollick 总结 prompting 研究,认为提示技巧价值下降,最有效的是清楚说明目标、输出、好坏标准和测试方式,本质上像管理。他还指出 Mechanical Turk 这类社会科学和调查研究基础设施正在被 LLM 使用侵蚀。另一个方向上,Mollick 对 Microsoft MAI-1 的官方 benchmark 保持谨慎,称缺少独立评测;Gary Marcus 则继续围绕 AI debt financing 和 capex 可持续性提出质疑。这些讨论共同把 AI 话题从“能力是否炫目”拉向真实使用、数据污染、独立 benchmark、边际成本和金融风险。
13/13 生成式视频和设计工具继续向轻量工作流扩散
Luma 宣布 Seedance 2.0 Mini 进入 Luma,强调视频生成速度足以支持 storyboard、测试多方向和快速收敛剪辑,定位是更轻量的创意工作流。Runway 则推出用自然语言生成设计幻灯片的能力,用户描述想看到的内容后得到美观 slide。它们与 Meta Muse Video、NVIDIA MOTIVE 形成同一天的三层信号:上游模型开始强调音频、时间一致性和运动数据归因;中层产品强调速度、迭代和模板质量;下游用户开始把视频、幻灯片、网页和游戏都纳入同一个 agentic creation 工作流。
Deep Dive 附录
Meta Muse Image / Muse Video
Meta 的 Muse Image 是 Meta Superintelligence Labs 发布的首个 image generation model,被设计成会调用工具和自我修正的 agentic model。它支持精确编辑、多参考图组合、Instagram social context、网页搜索 grounding、代码执行和 Muse Spark 协作。Meta 特别强调 RL 训练产生了 emergent self-refinement:模型会选择局部编辑、重新生成或调用工具来优化结果。Muse Image 也用 test-time compute 扩展能力,Meta 称 text + visual tokens 的预算与 Elo 有可预测 scaling,且优于普通 Best-of-N 采样。Muse Video 是同一预训练底座上的早期预览,支持 native audio,目标是提升 prompt adherence、visual fidelity 和 temporal consistency;当前仍重点改进音画同步和高速运动物理准确性。Meta 同时把 Content Seal provenance 信号接入 Meta AI 生成图片,并提供 public identification tool。 查看原文 查看原文
Google Predicting the Past / FireSat
Google DeepMind 的 Predicting the Past Skill 把 Gemini 接入 Aeneas 和 Ithaca 等专家模型,让历史学家用 plain English 研究 Greek 和 Latin texts。DeepMind 给出的三个挑战是:为每条 inscription 创建自定义分析和可视化;跨来源映射模式;让非编程用户调用高级 AI 工具。它把 Gemini 的交互能力和领域模型结合成 collaborative research partner。FireSat 则是另一个应用型 AI workflow:新增 3 颗卫星后,星座正走向每 20 分钟近实时 wildfire updates 的目标。Google 称首颗 FireSat 卫星已发现现有卫星看不到的野火,项目把 AI detection、satellite network 和 fire agencies 的响应需求放在同一系统中。 查看原文 查看原文
Databricks Genie Code / Omnigent / Lakeflow
Databricks 的三条更新共同指向 enterprise agent 的生产控制面。Genie Code 增加全页 command center,支持复杂多线程数据和 ML 工作,包含 review points、instructions、skills、connectors,并接入 MLflow、Model Serving 和 compute;未来 scheduled tasks 会让 agent 自主运行并交回结果。Omnigent contextual policies 用 session state 管理 agent,而不是孤立审批单个动作,可实现 session budget、dynamic risk scoring 和 least privilege。Lakeflow 则把 ingestion、transformation 和 orchestration 合并到统一平台,并通过 Unity Catalog 做中心化治理。Databricks 的叙事是:企业 agent 真正落地依赖数据管道、权限、审计、成本、上下文和治理,而不只是模型本身。 查看原文 查看原文 查看原文
Harness Engineering for Self-Improvement
Lilian Weng 的文章把 recursive self-improvement 拆成更现实的工程路线:与其期待模型直接改写自身权重,不如优化模型外围的 harness,包括 prompts、tools、memory、evals、search、trace mining、data feedback 和 execution environment。文章回顾 RSI 概念,并强调 self-improvement loop 的结构性难点:评价是否可靠、改进是否泛化、搜索是否丧失多样性、奖励是否被 hack、以及反馈闭环是否会放大错误。Sakana AI 推荐这篇文章时,把自己的 The AI Scientist、ShinkaEvolve 和 Darwin Godel Machine 放进同一框架:自动研究、程序进化和 agent 改写自身 harness code 都是 RSI 的局部实验,而不是已经解决的终局能力。 查看原文 查看原文 查看原文 查看原文
NVIDIA MOTIVE
MOTIVE 是 NVIDIA Research 针对 video generation 的 motion attribution 方法,获得 ICML 2026 Outstanding Paper Honorable Mention。它的出发点是视频模型训练中并非每个 clip 都同等有用,尤其是改善 motion 时,静态美观样本不一定贡献最大。MOTIVE 通过 gradient-based attribution 评估 fine-tuning clips 对 temporal dynamics 的影响,并把权重集中到 moving regions、降低 static backgrounds 的干扰。NVIDIA 称高影响 motion clips 可用于更有效 fine-tuning,在 VBench dynamics 和人工偏好上提升模型。它体现了生成式视频训练的一条关键趋势:从“更多视频数据”转向“识别哪些数据对特定能力有因果贡献”。 查看原文
LangChain Deep Agents / LLM Wikis
LangChain 相关讨论把 agent 质量问题落到 harness、memory 和 trace infrastructure。Deep Agents 是一个 model-agnostic open source agent harness,配套课程解释 agent 为什么需要 harness。LLM Wikis 则是另一类上下文机制:为代码库或领域维护可读、可更新的 wiki,让 agent 在长任务中获得稳定背景,而不是每次重新搜索或只读原始文件。LangChain 的活动页面把 DeepWiki、AutoWiki、Karpathy 的 LLM Wiki 说法和 OpenWiki 放在同一模式下。Harrison Chase 同时询问 ATIF 或其他 agent trace format 是否已被生产 runtime 采用,说明长会话步骤、工具调用、评估和可复用 trace 仍缺标准化层。 查看原文