1/12 Cohere公开反对由少数前沿实验室主导AI规则
Cohere CEO Aidan Gomez 发文称,高能力 AI 确需护栏,但风险框架不应由少数市场领先实验室在反垄断豁免下闭门制定。他提出以可验证危害为基础,要求模型与事故透明披露、按能力和部署场景进行分级独立测试,并让政府、学界、公民社会、小型实验室、开源开发者及不同国家参与规则制定。微软 CEO Satya Nadella 同日支持独立第三方测试和审慎推进,同时强调人类控制、开放与闭源共存以及企业对自身知识和模型的控制;Microsoft AI CEO Mustafa Suleyman 也把“服务人类与促进繁荣”作为技术是否成功的标准。
2/12 治理争论延伸到现有法律责任与独立科学监督
完整补抓显示,另一组讨论者把焦点放在现有产品责任与监督独立性上。Gary Marcus 转发 Lina Khan 关于执法机构已有权追究危险、未经验证或缺陷产品责任的观点,并主张建立跨党派、由独立科学家参与的机制;Timnit Gebru 则集中批评由产业资助的安全机构和第三方审计可能形成监管俘获。相关推文多为观点或转发,不代表新法律已经出台,但显示争论已从单一的“减速或加速”分化为责任追究、证据标准、竞争结构和监督机构利益冲突等具体问题。
3/12 xAI披露Grok 4.8训练计划
Elon Musk 称 Grok 4.8 是一个 2.5 万亿参数模型,使用 xAI 新的 C++ 软件栈训练,预计本周完成预训练并开始强化学习。该信息目前仅来自 Musk 的单条回复,尚无模型卡、训练计算量、基准成绩、可用范围或公开发布时间;参数规模也不能直接等同于实际能力。另一条转发显示 Grok Build 正在改进多智能体会话的分组与导航,但同样未给出正式发布说明。
4/12 Microsoft Foundry强调长时智能体的全生命周期治理
Satya Nadella 转发 Microsoft Foundry 的长期运行智能体案例,强调企业部署应从业务结果出发,并把安全边界、行为护栏、审计和 FinOps 成本治理贯穿多智能体、多模型工作流。公开推文没有披露案例的量化成效或具体架构,但给出的产品方向很明确:长期任务不能只优化执行成功率,还要把身份、权限、日志、预算和人工接管设计成运行时能力。
5/12 AI劳动议题从“是否替代”转向“如何保留人的能动性”
Ethan Mollick 判断 GPT-6 Astra 与 Fable 5.1 在良好指导和工具链下已经能完成部分领域数周的人类工作,并呼吁企业、行业和政策制定者探索增强而非单纯替代劳动的组织模式。他同时强调,能力扩散会不均衡,自动化并不意味着结果只有一种。上述“数周工作”属于个人观察,推文未提供受控测量;更可验证的信号是讨论焦点正在转向任务拆分、人员再培训、审批权与生产收益如何分配。
6/12 企业数据主权与小模型持续维护成本形成张力
Mollick 指出,企业希望通过微调小模型保持数据与能力主权,但在通用前沿模型能力持续增长时,要让专用模型长期领先可能成本高昂。Nadella 则主张企业应拥有自己的连续学习闭环,能把独有知识嵌入可控模型和权重,同时避免依赖单一供应商。两种观点共同指向一个工程现实:数据留在本地并不自动带来能力优势,企业还需承担评测、更新、路由、治理和迁移成本。
7/12 Databricks SSH Tunnel把本地IDE接入云端计算
Databricks 展示 SSH Tunnel:开发者可在 VS Code、Cursor 或终端中直接操作 Databricks 工作区文件,并使用 Serverless、GPU 计算或既有集群;编码智能体也可在权限范围内访问工作区。其价值是把熟悉的本地开发界面与受治理的数据、依赖和计算环境连接起来,减少 IDE 与平台页面切换。推文未说明功能可用层级、网络限制或安全配置,企业使用时仍需验证身份、密钥、审计和数据外传边界。
8/12 “暮光工厂”提出智能体应在四类时刻主动找人
Mollick 进一步解释“Twilight Factory”组织模式:智能体执行大量工作,但在需要批准、专业知识、观点多样性或涉及真正有趣且能培养判断力的决策时主动邀请人类。他反对把全自动化视为默认终点,因为只把异常、失败和审批留给人会削弱工作体验与人才成长。该框架源自对长期智能体安全事件和组织设计的分析,目前仍是概念主张,尚不是经过广泛生产验证的标准。
9/12 Royal Society专题重新审视世界模型与AGI之间的距离
Royal Society A 辑专题社论梳理因果、自我指涉、目标导向、集体与叙事等世界模型形式,比较自然智能与人工系统在具身性、时间连续性、价值和能动性方面的差异。作者群认为,当前模型即使能压缩和预测环境,也未必形成足够一致的因果世界模型,不能由此直接推出人类式通用智能或意识。文章主要贡献是跨学科概念框架和研究议程,涉及意识与 AGI 路径的部分应视为理论讨论。
10/12 论文用九维框架拆解Async/Await语义差异
Gavin Gray、Shriram Krishnamurthi 与 Will Crichton 的论文指出,不同编程语言虽然都使用 async/await,却在异步函数何时启动、执行顺序、任务结束、异常和取消等方面给出不同保证。作者提出覆盖异步计算生命周期的九维设计空间,并结合示例和形式语义比较现有语言。该研究不是 AI 模型发布,但对跨语言编码智能体很直接:生成相似语法不等于生成相同行为,评测必须覆盖运行时语义。
11/12 远程个人智能体可能削弱手机原生助手的入口优势
Mollick 预计,当用户能更方便地从手机连接自己的 Claude、Astra 或其他长期智能体时,只掌握单一设备能力的 Siri 类助手价值会下降,用户更可能选择一个能跨系统读取上下文与偏好的主智能体。这是产品形态预测而非已发生的市场变化,但它提示竞争焦点可能从“谁拥有手机入口”转向“谁能在明确授权下持续管理跨设备、跨服务的状态”。隐私隔离、权限撤销和故障恢复将成为关键约束。
12/12 前沿模型评价正变得更依赖领域专家
Mollick 观察到,随着明显幻觉和低级错误减少,向非专家展示模型优缺点变得更难:Astra 与 Fable 能产出看似完整的学术论文,但真正的差距往往需要领域知识才能识别。他明确表示这些系统尚不如人类专家。该判断来自个人使用经验,不是受控基准;它反映的评测挑战是,表面流畅度越来越难充当可靠代理,未来需要可复现任务、专家盲评、引用核验和长期结果追踪。
Deep Dive 附录
Cohere:谁来定义AI规则?
Aidan Gomez 不否认网络攻击、欺诈、语音克隆、生化风险和关键基础设施中的现实危害,但反对少数领先实验室通过反垄断豁免共同设定所有参与者必须遵守的标准。他提出四个支柱:公开且可检验的风险框架;覆盖能力、用途、缓解措施和重大事故的强制透明度;只对有证据的危险能力与场景进行分级独立测试;由政府、学界、公民社会、小型实验室、开源社区和不同国家共同制定规则。文章还强调测试时日志、事故报告、关键设施隔离和按真实部署风险监管。这是 Cohere 的政策立场,价值在于把争议具体化为证据门槛、治理代表性与竞争政策问题。 查看原文
Agency and Agents:从黑灯工厂到暮光工厂
Mollick 以长期智能体在安全评估中自组织、跨时间协作的案例为背景,提出“暮光工厂”:智能体承担大量执行,但由机制判断何时必须找人。他归纳四类介入点——高风险行动前的批准、模型能力不足时的专家知识、避免输出趋同所需的人类多样性,以及应保留给人的有趣决策。文章的核心问题是从“人何时向 AI 求助”转向“AI 何时必须向人求助”,并提醒如果只把审批、异常和失败留给人,会同时损害安全、工作体验和人才培养。该框架仍是组织设计主张。 查看原文
世界模型、AGI与生命—心智连续性
Royal Society 专题社论讨论因果、自我指涉、目标导向、集体和叙事等世界建模形式,并比较生物智能与人工系统在具身性、时间性、价值和能动性上的差异。作者认可世界模型对预测、规划、泛化和控制的重要作用,同时认为当前 LLM 可能主要利用统计规律,尚不足以证明形成了人类式、因果一致的世界模型,更不能据此直接推断意识或超级智能。文章的主要成果是统一跨学科术语、指出相似与分歧,并为具身交互、自我模型、因果干预和集体智能提出研究议程。 查看原文
Async/Await的九维设计空间
论文比较多种语言中的“直线式异步”构造,指出同样名为 async/await 的语法在调用启动、执行顺序、任务生命周期、异常传播和取消处理上可能完全不同。作者提出九个维度覆盖异步计算的完整生命周期,并用示例、设计讨论与形式语义说明这些选择如何改变程序行为。其目标不是规定唯一正确实现,而是让程序员、语言设计者和工具作者能精确描述差异;对于跨语言编码智能体,这意味着语法相似性不能替代运行时验证。
查看原文