EZ.AI Listen Daily
大语言模型的预训练,长期以来几乎就是“烧钱”的代名词。过去的经验让人望而却步:想要训练一个3B规模的模型,动辄需要上百万美元。比如,训练Llama-3.2-3B的成本超过150万美元,即便是开源社区引以为傲的SmolLM3-3B,也需要超过70万美元。这堵高墙把大部分学术机构和独立开发者挡在了门外。
但一项新的工作试图把这堵墙凿开一道口子。研究团队发布了一套完整的开源预训练配方,并以此训练了Puro-2B系列模型。他们用消费级的RTX 5090显卡,以FP8低精度方式,从头训练了高达1.4万亿个token。这是一个什么概念?整个系列里性能最好的那个模型,训练成本竟然不到6900美元——和前面那些百万、七十万的数字比起来,简直像是另一个世界的价格。
更令人惊讶的是,这个“廉价”模型并没有做得很差。在团队的评测协议下,它的表现已经接近Qwen2.5-1.5B。也就是说,用不到七千美元的算力,就可以追赶一个在社区里广受好评的1.5B模型。这背后靠的可不是单一技巧,而是一套组合拳:精心选择的硬件、低精度训练方案、hyperball优化、课程式模型平均,以及一套讲究的数据配方。
这项研究还给出了两个更有意思的副产品。第一个是一条“Puro成本缩放定律”——它把训练花费与模型平均表现联系起来,拟合结果显示,大约只需要4400美元,就足以达到Qwen2-1.5B的水平。如果这个定律在更大规模上成立,那么预训练“富者愈富”的格局可能要被重新审视。
第二个副产品是一项端到端的案例研究:团队利用完整的预训练流程,仔细考察了数据课程如何影响后续微调任务的表现。这种研究在过去很难做,因为很多开源项目只开放权重,不开放完整的训练管线。而这项工作把数据、代码、模型权重全部以Apache 2.0协议开源,意味着任何人都能复现、验证,甚至在此基础上继续探索。
一个更开放的预训练时代,也许比我们想象的更近。当成本不再是横亘在知识与探索之间的天堑,真正值得思考的问题就变成了:我们该如何更聪明地使用这些来之不易的算力,而不是仅仅追求更大。
在人工智能的探索中,让智能体从自身经验中学习并不断进化,一直是研究者追求的目标。然而,一个关键问题长期存在:智能体在优化过程中获得的宝贵洞察,往往散落在历史记录里,难以被系统性地复用。就像一位从不写笔记的工匠,每次都要重新摸索技艺。
现在,一项名为WikiSkill的研究带来了新的思路。这个框架巧妙地将智能体的运行经验、累积知识和可执行技能三者分离,并让它们形成一个持续进化的循环。核心创新在于引入了一个持久化的知识库——“wiki”,它像一个不断增厚的笔记本,持续将每次执行的经验固化下来,供后续的技能更新参考。这不再是简单的“从经验中学习”,而是“从不断积累的知识中进化”。
实验结果令人振奋。在多个基准测试和不同模型上的表现显示,WikiSkill不仅稳定优于最先进的技能进化方法,而且在大多数模型与基准的组合中,都超越了没有技能增强的基线模型。研究还揭示了一些耐人寻味的规律:技能进化与模型规模之间似乎存在互补关系——更大的模型通常从进化技能中获益更多,但有趣的是,较小的模型一旦配备了进化技能,甚至可以超越那些明显更大但缺乏技能的模型。更令人惊讶的是,这些进化出的技能展现出强大的跨模型迁移能力,不仅能在不同模型之间转移,甚至由其他模型进化的技能,效果可能比模型自己进化出的技能还要好。
通过消融实验,研究者确认了持续知识积累的关键作用:如果没有wiki这个“笔记本”,技能进化的效果会大打折扣。这项研究的意义在于,它系统地证明了将智能体的经验进行有组织的积累和提炼,对于开发可复用、可迁移的技能至关重要。这或许意味着,未来智能体的成长之道,不在于每次都从头开始,而在于懂得如何站在自己过往知识的肩膀上,不断向上攀登。
一只多指机械手能否像人手一样灵活?在机器人研究领域,这个问题的答案长期被一个残酷的瓶颈卡住——数据。大规模预训练让机器人策略微调变得越来越高效,但这份红利几乎被结构简单的平行夹爪垄断。真正灵巧的多指机械手,因为真实遥操作成本高昂、难以规模化,始终处于数据贫瘠的状态。至于人类手部视频,虽数量庞大,却因为"跨本体"问题,需要经过有损的姿态估计与重定向才能使用,效果大打折扣。
为了打破这个僵局,研究者提出了一套名为SPD的预训练框架。它的独特之处在于:所有训练数据完全来自仿真环境,无需真实机器人参与。操作员戴上VR头显,走进虚拟世界,用双手直接操纵虚拟物体。这样既采集到了与真实本体完全匹配的轨迹,
设想一台家务机器人已经学会了整理书架,现在你教它把同一本书放进收纳箱。它很快学会了新指令,但当你再次让它整理书架时,它却一脸茫然——它忘了旧技能。这种“灾难性遗忘”是机器人走向真实世界的一道坎。常见的解决办法是把过去学过的数据存进一个“重放缓冲区”,时不时拿出来温习。但科学家发现,并不是所有旧经验都同等重要。真正起关键作用的,是一小撮被称为“Memory Anchors”(记忆锚点)的数据。
这些锚点藏在哪里?它们出现在新旧任务特征高度重叠的区域——比如同一个物体,旧任务要求“推”,新任务却要求“拉”。此时机器人的内部表征发生冲突,旧知识与新知识在此“短路”。在冲突区域重放旧数据,反而能有效阻止新知识“粗暴覆盖”旧知识。
为了验证锚点的作用,研究团队在著名的LIBERO机器人操作基准套件上做了对比实验。结果令人震惊:仅仅在采样前剔除10%的记忆锚点,灾难性遗忘程度就飙升了4.5倍以上。反过来,如果在重放缓冲区中刻意加入更多记忆锚点,高冲突任务中的遗忘率能降低63%。更难得的是,在真实机器人上,靠着这种思路,机器人成功连续学会了两组任务序列,而没有被遗忘问题绊住。
这个发现挑战了“重放数据随便抽”的传统做法,提醒我们:学习的质量,往往取决于那些看似微小却关键的“锚”点。也许对机器人如此,对人类亦然——真正让我们不忘旧的,不是复习一切,而是守住那些与旧记忆产生纠缠的时刻。
想象一下这样的场景:一个机器人正在执行精细的操作任务,它的“大脑”——一个庞大的视觉-语言-动作模型——需要时间来规划下一步动作。在这段推理延迟期间,机器人要么停滞不前,要么动作变得生硬而突兀。这正是当前机器人强化学习研究面临的一大困境。
长期以来,强化学习被视为让通用机器人策略在部署中持续改进的有效途径。然而,现代通用策略模型(如VLA,即视觉-语言-动作模型)的庞大体量,却为强化学习的有效应用设置了根本性障碍。它们的严重推理延迟会导致机器人动作停顿或抖动,这不仅影响操作流畅度,更可能改变环境动态的感知——当延迟未被正确考量时,强化学习所依赖的马尔可夫假设就会被打破,导致标准的强化学习算法完全失效。
为了解决这一难题,研究者提出了ARLI框架——一个具有延迟感知能力的异步强化学习框架。这一名字本身就揭示了它的核心思路:通过异步推理策略,将动作生成与执行交错进行,从而巧妙地隐藏延迟。但仅仅做到异步还不够,ARLI还通过两个关键贡献来最大化推理窗口内的反应性:一是状态增强机制,通过纳入已执行的动作来恢复近似马尔可夫结构;二是引入推理中期的观测信息,让策略能够对环境的实时变化做出更及时的响应。
研究团队在仿真环境和真实世界的操作任务中对该框架进行了系统评估。结果令人振奋:在推理延迟存在的条件下,标准强化学习已经彻底失灵,而ARLI却能实现有效的微调优化,甚至在理想的零延迟设置中也能达到甚至超越标准强化学习的水平。
这项研究的价值不仅在于提出了一个可行的技术方案,更在于它重新审视了“智能体-环境交互”的基本假设。当机器人的“思考速度”跟不上环境的节奏时,我们需要的不是等它想清楚,而是让它学会与延迟共处。ARLI告诉我们,真正的智能不在于无所不能的即时反应,而在于即便存在认知延迟,依然能够稳健地学习和改进。这或许也是智能系统发展的一个永恒命题:如何在自身的局限中,找到与这个世界和谐共舞的方式。
想象一下,一台机器人正在执行精细的抓取任务,它的每一个动作都依赖于视觉、语言和动作模型的协同推理。这类被称为视觉-语言-动作(VLA)的模型,正逐步成为机器人操作领域的热门方案,然而真正的现实部署却卡在了两道难关上:推理延迟太高,异步执行又不够稳定。尤其是基于流匹配的VLA模型,每生成一个动作都需要在视觉语言模型的指导下进行多步迭代解码,计算负担格外沉重。
现有的提速手段要么只专注于提升控制频率,要么只试图减少异步执行中的空闲等待,却很难同时做到“又快又准”——既保持低延迟推理,又保证动作在时间上连贯一致。面对这一矛盾,研究者提出了一个名为FlashVLA的统一解决方案,它本质上是种流式动作解码框架。
FlashVLA的巧妙之处在于,它不再按部就班地等待完整动作序列生成完毕,而是维护一个流式动作缓冲区,里面存放着处于不同噪声级别的多个动作块。通过分块因果注意力机制,这些动作块被逐一解码,每个推理步骤都能直接产出一个可执行的动作块。这种设计让控制频率大幅提升,更关键的是,分块自回归的形式天然保留了动作之间的连续性,无需额外预测未来状态,就能实现平滑的异步执行。
研究团队在大量仿真和真实世界实验中验证了FlashVLA的表现。结果显示,它能够显著加快推理速度,同时维持强劲的任务完成度——在单个GPU上即可达到至少30Hz的控制频率,并在实际部署中保持异步推理的流畅性。这意味着,机器人不再像“卡顿的视频”一样一帧一帧地挪动,而是能以近乎实时的节奏响应环境变化。
FlashVLA的出现,为高动态机器人操作提供了一条兼顾速度与稳定性的路径。当动作解码不再是瓶颈,机器人离真正走进车间、厨房甚至我们的日常生活,或许又近了一步。技术的进步往往就藏在这些“流式”的细节里——让每一帧动作都恰到好处,让每一次响应都行云流水。
全球面临的粮食安全、灾害风险、疾病暴发等挑战,都离不开高保真的地理空间建模。然而,构建预测行星尺度的模型长期受困于数据生态的碎片化——研究人员需要手动抓取数据、整理多模态信息、反复挑选模型。如今,一个名为行星预测引擎(PPE)的自主AI系统打破了这一瓶颈。它只需接收自然语言查询,就能端到端地完成整个流程:实时整合来自Data Commons和Google Earth Engine等开放数据源及地球观测平台的多模态数据集,并与PDFM、AlphaEarth等地理空间基础模型的嵌入向量融合;同时,它还能自动搜索适配任务需求的模型架构,并内置过拟合防护机制。
在跨任务、跨地域、跨学科的多项测试中,PPE的表现持续超越现有最优方法或人工调参的专家基线。在美国空间回归任务中,PPE将21个CDC健康指标的平均R²从60.0%提升至76.8%,FEMA国家风险指数从60.0%提升至64.9%,社会脆弱性指数从58.6%提升至66.2%。在数据稀缺地区的空间降尺度任务中,PPE通过整合本地代理变量,使尼日利亚粮食安全指标的R²从31.5%翻倍至66.1%。面对2026年刚果(金)本迪布焦埃博拉疫情的流行病学临近预测,PPE的Recall@10达到83.3%,在五周预报中成功识别出18个新入侵卫生区中的15个,较公开最优模型的约73%提升了10.3个百分点。
这套系统之所以强大,在于它把自主的多模态行星数据发现与针对性的模型优化结合起来,极大降低了行星级数据分析的技术门槛。过去需要数月的数据工程与模型调优,如今只需一句自然语言指令。PPE所揭示的方向令人深思:当AI能自主驾驭海量地球数据并定制专属模型时,科学发现的速度将不再受限于人工操作,而专业知识的普惠化,或许才是应对全球性挑战的真正突破口。
在机器人视频生成领域,一个长期存在的瓶颈是:大多数动作条件视频模型只能服务于单一机器人形态,无法从互联网上那些海量的、包含丰富物理规律的人类与机器人异构视频中汲取通用知识。为了打破这一壁垒,研究人员提出了CLAP框架——一个能够跨形态训练的动作条件视频生成系统,其训练数据可覆盖人类与多种机器人代理,规模直达互联网级别。
CLAP的核心洞察朴素而深刻:无论动作执行者是人类还是机器人,普遍存在的物理定律始终支配着时空动态变化。然而,跨形态学习并非易事,因为不同机器人平台的动作表示差异巨大,且人类视频中通常不存在显式的动作标签。CLAP通过三个关键贡献攻克了这一挑战。
首先,CLAP统一了差异悬殊的动作空间,巧妙地将末端执行器位姿、语言指令和潜动作三种表征融为一体。其次,为了化解各自表征的局限,CLAP设计了一套基于课程学习的跨形态训练方案:先利用潜动作在海量未标注视频上学习基础的物理先验,再将先验锚定到末端执行器动作空间,从而实现对真实世界任务的零样本部署。尤为亮眼的是,在DROID这类高难度环境中,CLAP已接近甚至超越了最先进单形态视频模型的性能,而通过少量样本自适应,这些优势还能进一步叠加,为单形态世界模型的训练开辟了新范式。
最终,CLAP打造了迄今最全面的动作条件视频世界模型套件,覆盖多种动作条件空间(末端执行器、语言、潜动作)和多种机器人形态(跨形态、DROID、Bridge、双臂YAM机器人以及G1人形机器人)。所有代码与模型均已开源。
技术从来不是孤立的参数堆叠,它源于对物理世界统一规律的执着追问。当不同形态的智能体共享同一套时空先验,机器人学习便不再是一座座孤岛,而是一片彼此连接的大陆。
一块原本临界温度仅有8开尔文的铁硒超导单晶,在氢原子悄无声息地渗入其晶格之后,竟被观测到在295开尔文——也就是接近室温的环境下,依然保持着超导的迹象。这不是科幻小说,而是一组来自电子顺磁共振谱仪的真实测量数据。
研究人员将氢气通过热扩散方式引入铁硒晶体,得到了名为Fe-Se-H的粉末化合物。随后,他们在磁场强度从零到6000奥斯特的范围内,测量了该粉末在不同温度下的微波功率吸收情况,温度点覆盖了3.6至25开尔文的低温区间,以及295开尔文的室温点。看起来枯燥的曲线形状和数据分析,却指向了一个惊人的结论:无论是在深冷的3.6开尔文,还是在接近人类日常体温的295开尔文,这个材料都表现出超导特征的响应。
这并非普通的电阻测量,而是通过自旋共振对材料内部电子行为的间接探测。吸收曲线的特征与超导态下的配对机制吻合,让研究者认为Fe-Se-H化合物在常压下就具备了超导能力,无需施加极端压力,也无需依赖液氦降温。当然,室温超导一直以来都是物理学界的圣杯,每一次宣称都伴随着激烈争论和反复验证。这项实验以磁共振手段给出了新的证据链,但距离真正的应用和共识,仍有漫漫长路。
氢在高温超导家族中扮演着神奇的角色,它似乎在铁硒的层状结构里重新编排了电子之间的舞步。如果这些数据经得起更多实验的检验,那么室温常压超导的梦想将向前迈出一大步;即便仍有争议,它也提醒我们,科学突破往往藏在细微的曲线拐点和看似微不足道的温度读数之中。探索的脚步从未停歇,而答案或许就在下一次看似寻常的测量里。
在硅谷的实验室里,一场关于逆转衰老的豪赌正在上演。长寿初创公司Generation Lab宣称,他们找到了一种让“旧血”重新焕发青春的方法——每周注射一次两种现有药物的组合,而这两种药物目前连名字都严格保密。据麻省理工科技评论报道,这种神秘的注射剂已经开始进入人体,一小群医生和公司内部人士已经亲身尝试,并报告了令人振奋的积极反馈。
这背后的科学并非空穴来风。联合创始人伊琳娜·康博是加州大学伯克利分校的知名研究员,她曾做过一项里程碑式的研究:改变老年小鼠的血液环境,就能恢复其组织再生的能力。这项研究在衰老生物学领域投下了一颗重磅炸弹,也让“换血回春”从古老传说变成了严肃科学课题。如今,康博声称找到了破解密码的钥匙——她利用一种快速筛选模型,将候选化合物直接作用于浸泡在“老化血液血清”中的人体组织,最终锁定了这组双药组合。
然而,目前的一切都笼罩在迷雾中。Generation Lab没有公布任何人体对照试验数据,所谓“积极结果”仅仅来自少数内部试用者的口头报告。公司一边雄心勃勃地计划启动一项超过百人的正式研究,一边死死捂住药物名称,声称是为了推进临床试验和未来FDA审批时保持竞争优势。换句话说,这项疗法有着耀眼的学术血统,却还缺少一块最重要的拼图——铁证如山的人体证据。
衰老研究领域一直对“年轻血液”充满遐想,但Generation Lab试图把这种复杂的生物学效应简化成一剂普适的日常药方,这无疑站在了严肃抗衰科学与硅谷生物黑客文化的交叉路口。乐观者看到了老龄化社会的新希望,怀疑者则警惕地注视着这家公司用“神秘感”包装的临床试验。无论结果如何,这场实验提醒我们:在追逐永生的路上,最危险的或许不是衰老本身,而是令人心动的承诺背后,那些尚未被证实的事实。科学需要时间,而时间恰恰是它想要征服的东西。
废塑料变饼干,太空食品新革命原文
当人们还在为塑料污染发愁时,一群美国科学家已经想出了一个大胆的解决方案:把废弃的塑料瓶变成可以吃的饼干。这听起来像是科幻小说里的情节,但事实上,他们真的做到了——至少做出了原型。
这个项目最初是为NASA设计的,目标很简单:让宇航员在漫长的深空任务中,不必携带大量食物,而是利用飞船上的废弃物就地生产口粮。科学家先把PET塑料分解成富含碳的简单化合物,然后喂给特定的酵母菌株,让这些微生物把碳转化为可食用的生物质。这些酵母就像是微型工厂,将原本毫无营养的塑料变成蛋白质和其他营养成分。
更神奇的是,不止一种酵母参与了这个过程。科学家通过基因工程改造了面包酵母,让它能从植物废料中合成香兰素——也就是香草味的来源。另一种酵母则能把PET塑料中的乙二醇转化为β-胡萝卜素,为食物提供橙黄色的色泽和维生素A。这些成分混合在一起,加入淀粉、纤维和甜味剂,最后用3D打印机制成一口大小的饼干,再放进微波炉加热成型。
不过,目前还没有人获准品尝这些饼干。毕竟,把塑料变成食物这件事,听起来总让人有些心理障碍。但研究人员表示,这个系统的意义远不止于此。它是一个闭环系统:废物进入,微生物将碳转化为食物,从而减少对外部补给的依赖。除了太空,它还可能应用于潜艇、灾区等资源有限的极端环境。
当然,这仍是一个早期原型。成本、规模、监管审批,还有最重要的——味道,都是摆在科学家面前的现实问题。塑料变食物听起来有些反乌托邦,但换个角度看,它提供了一个值得深思的循环思路:我们生产和消费产生的废物,也许不该被视为终点,而可以成为另一种资源的起点。在资源日益紧张的未来,这样的想法或许不再只是科幻。下一次当你看到塑料瓶时,是否会想到它可能成为你餐桌上的饼干?技术的边界,从来都是被想象力推着前进的。
一场围绕青少年网络安全的博弈,正以出人意料的方式改写硅谷的游戏规则。科技巨头Meta近日与美国数十个州达成了一项高达180亿美元的和解协议,用以平息“脸书”和“照片墙”故意设计成瘾机制、淡化风险、让青少年深陷其中的指控。然而,这份和解协议的奇特之处在于——其中约53亿美元能否真正落袋,取决于它的两个最大竞争对手:TikTok和YouTube,是否愿意接受同样的限制,并各自掏出约60亿美元的“等价补偿”。
Meta显然不想独自站在聚光灯下。它不惜在主流报纸上刊登整版广告,向对手发出公开信,明确呼吁TikTok和YouTube采纳相同的青少年保护措施。这封信的潜台词再直白不过:既然要罚,那就一起罚;既然要改,那就一起改。而更深层的原因在于,Meta的巨额资金被绑在了对手的行动上,如果另外两家不配合,这笔钱可能悬空。
那么,这份和解协议究竟要求平台做什么?根据协议内容,青少年账号将面临每天两小时的使用上限,夜间时段强制关闭,上课时间通知静音,更严格的年龄验证,以及定时弹出的休息提醒。这些措施直指此前被广泛诟病的“无限滚动”和“通知轰炸”式设计。值得注意的是,Meta虽然付出了巨额代价,却保住了最核心的商业模式——个性化推荐和精准广告依然照常运转。这意味着,所谓的“让步”并没有触及它的利润根基。
这场和解的分量不止于金钱。它标志着美国各州对社交媒体平台的监管从口头警告走向实质行动。数十个州联合施压,迫使Meta承认了其产品设计对未成年人造成的伤害,尽管它在法律上仍不承认任何过错。而Meta的下一步棋,更是将这场危机转化为一场行业标准之争——它试图把自己被迫接受的规定,变成全行业的“标配”。如果TikTok和YouTube拒绝,那么Meta不仅节省了53亿美元,还能在舆论上占据道德高地;如果他们接受,整个行业的青少年使用体验将迎来一次集体重塑。
当然,TikTok和YouTube是否会乖乖接招,仍是未知数。前者正值全球监管风暴中心,后者背靠谷歌的庞大生态,它们或许会讨价还价,或许会提出替代方案。但无论如何,Meta已经把一个原本属于法律层面的和解案,变成了一场公开的行业绑架。当一家公司用数十亿美元做筹码,逼着竞争对手与自己一同“改过自新”,这究竟是真心保护孩子,还是一次精心计算的商业博弈?或许两者皆有。
这场大戏的后续,将决定未来十年青少年在数字世界里的生存方式。而一个更值得追问的问题是:当平台们的限制措施终于落地,家长们是否真的能松一口气?技术公司们用算法制造的注意力黑洞,真的靠几道“时间锁”就能填平吗?答案,恐怕没那么简单。
2024年底,一场突如其来的癫痫发作,让原本毫无症状的里维斯·希伯特被紧急送医。检查结果令人心惊:他的脑内竟藏着一枚11毫米的垂体肿瘤,正悄然压迫视神经,让他的视野一天天变窄。
伦敦大学学院的医生们决定为希伯特实施手术。但这一次,手术台上多了一位特殊的“助手”——一套实时AI系统。它通过手术摄像头全程“观看”操作画面,在屏幕上精准标注出最安全的切割路径,以及必须避开的隐藏动脉和视神经。外科医生哈尼·马库斯评价说,这套AI相当于见过“比大多数外科医生一辈子做过的手术还要多”的病例。
手术从希伯特的鼻腔进入,抵达脑部病灶。在整个过程中,主刀医生始终掌握着绝对控制权,而AI则像一位经验丰富的第二专家,安静地观察、提示,把风险降到最低。肿瘤被成功切除后,仅仅几天内,希伯特的视力就恢复了正常。
这不仅是医学史上首次在活人脑外科手术中引入实时AI辅助,更预示着未来手术室的可能图景:距离机器人独立执刀或许还有距离,但AI作为“超级监视员”介入手术,已是触手可及的现实。当机器比人更懂风险时,人类医生的角色,或许将从“独自决策”转向“精准协作”。每一次技术跃迁,最终受益的,都是那些渴望重见光明的生命。
想象一下,实验室里的显微镜、机械臂和流水线设备,原本需要工程师花费数周时间编写定制代码才能与AI对接。现在,Anthropic公司发布了一项名为Model Hardware Standard(MHS)的研究预览,试图将这个过程缩短到“数小时甚至几分钟”。这套标准与该公司此前推动AI代理连接软件的Model Context Protocol(MCP)一脉相承,只不过这次目标是物理世界。
它的运作方式很巧妙:设备所有者只需用自然语言描述自己的机器,MHS就会将这些描述转化为一份参考文件,AI代理读取后便能自行学习如何操作。在一次测试中,Claude通过反复试错学会了校准激光,甚至将这个流程简化成一段脚本,一次性完成自动化操作。这不再是人类逐行编写指令,而是让机器学会“读懂”机器。
Anthropic计划未来开源这一标准,并已拉上Tecan、QIAGEN和AWS作为合作伙伴,同时Hugging Face和Raspberry Pi也准备将其纳入自家设备产品线。这背后是一场关于“物理AI”的暗战——许多公司都在争夺让大模型落地到真实设备的机会,而Anthropic的选择是,让连接硬件变得像连接软件一样自然。
当AI不再局限于屏幕里的对话框,而是伸手触碰现实中的齿轮与镜头,我们或许正在见证一个新时代的起点:机器与机器的对话,不再需要翻译官。
在计算机视觉领域,视频一直被认为是一座蕴藏丰富物理世界动态信息的金矿,但开采它的成本高得惊人。传统自监督学习方法往往依赖复杂的架构设计来防止模型崩溃,比如使用指数移动平均的目标编码器、梯度停止或容量受限的预测器,又或者通过像素空间重建掩码内容来间接学习。这些方法虽然有效,却让预训练的计算开销成为横亘在研究者面前的一座大山。
现在,一项名为LeVJEPA的新研究开辟了一条截然不同的路径。它的核心思想极其简洁:一个单一的编码器,搭配一个投影器,仅通过一个单一的超参数,就实现了对全局和局部视图的不变学习。它抛弃了所有复杂的对称性设计,转而使用一种名为SIGReg的正则化项,从数学上严格保证了表示不会坍塌。整个架构简化到极致,仿佛从一台精密的机械钟变成了一枚干净的石英表。
这种极简主义带来了两个意想不到的好处。第一个好处直击成本痛点:既然预训练的算力消耗取决于编码器看到的token数量,那么通过均匀随机丢弃部分token,就能在降低计算量的同时,反而提升下游任务的准确率。在完全相同的数据和训练轮数下,LeVJEPA在ViT-S/B/L三个规模上均匹配或超越了强大的V-JEPA 2基线,而预训练算力仅为其5.6分之一到20.8分之一。如果固定总算力,它在ImageNet-1K上比最强的视频基线高出7.6个百分点,在运动中心基准上也保持竞争力。这意味着,视频预训练昂贵的时代可能就此终结。
第二个好处更令人惊喜:由于分支间不再需要任何架构不对称,编码器可以直接采用块因果注意力训练,而精度几乎不受损失。时间顺序不再是数据增强的副产品,而是编码器自身的内在属性。在与算力匹配的、仅用相同视频帧训练的DINOv2对比中,LeVJEPA在外观中心评估上逼近了这个图像预训练的强大对手,而在运动中心准确率上几乎是其两倍。
这些结果指向一个更深层的结论:一旦摆脱计算开销的枷锁,视频或许比静态图像更适合作为通用视觉预训练的原料。毕竟,世界是在时间中流动的,而模型终于可以更自由地捕捉这种流动。当复杂性不再必要,简单本身就成了最有力的武器。
在大型语言模型的数学推理能力提升之路上,强化学习和策略自蒸馏等后训练方法功不可没,但它们都有一个共同的前提:需要真实标签。这意味着模型一旦部署到新环境,面对没有标准答案的问题,就失去了继续“自我进化”的能力。于是,研究者们自然想到用多数投票产生的伪标签来代替真实答案,让模型在测试时也能自我训练。然而,这把双刃剑很快露出了破绽——如果多数投票给出了错误答案,那么被伪标签“污染”的教师信号会误导模型的所有后续学习,反而让模型越学越偏。
仔细观察这种失败模式,研究者发现了一个不对称的规律:当某个采样回答与伪标签不一致时,无论伪标签本身是否正确,这个回答几乎总是错的。换句话说,分歧本身就是一种可靠的错误信号。基于这一洞察,一项名为“测试时策略优化”(TTPO)的新方法应运而生。它的核心思路是“区别对待”:对于与伪标签一致的回答,采用策略自蒸馏的方式让模型吸收其知识;对于与伪标签相悖的回答,则使用分组强化学习给予惩罚。这种不对称的目标函数,让模型在错误频出的伪标签环境下依然能保持更新的正确方向。
更精妙的是,TTPO还在词元级别做了精细打磨。在蒸馏分支中,对模型已经很有把握的位置降低权重,不做无效重复;在强化学习分支中,只惩罚那些模型“自信但出错”的令牌,避免误伤模糊地带。这样一来,即使伪标签频繁出错,两种更新机制都能保持稳健。而且,随着模型能力的提升,多数投票的路由机制会自然产生更准确的自我监督信号,形成良性循环。
实验结果是令人振奋的。在不使用任何真实标签的前提下,TTPO在五个竞赛级数学基准上追平了依赖标签监督的策略自蒸馏方法。以Qwen3-1.7B模型为例,测试时训练将准确率从38.0%提升到了45.2%;在不允许“思考”标记(即直接输出)的情况下,提升幅度高达25.2%到36.4%。更难得的是,该方法展现出了强大的跨任务泛化能力,意味着它学到的推理策略可以迁移到其他类型的任务上。
这不禁让人思考:当模型能够在没有标准答案的环境中自主判断、自我修正,我们距离真正“会学习”的智能体,又近了一步。测试时训练的想象空间,或许才刚刚被打开。
想象一个不眠不休的研究伙伴,它不仅能提出科学假设,还能亲自走进实验室,操作设备,甚至写出论文。谷歌的Co-Scientist系统,正是这样一位基于Gemini模型的多智能体助手,它正从纯粹的计算机模拟,进化为真正参与实验的科研伙伴,在材料、生物与计算机科学领域展现出惊人的实力。
在材料科学领域,Co-Scientist与半自动化化学气相沉积反应器直接对接,设计出一条更安全的MXene前驱体合成路线。实验产物呈现出层状二维材料结构,与Ti3C2Tx MXene的晶格有着关键相似性——尽管其原子结构仍需进一步验证。更令人惊叹的是,借助Gemini 3 Deep Think的快速推理能力,它能在短短几分钟内,根据实验室的具体限制条件调整生长配方,并一次性成功生长出单层的MoS2、MoSe2和WS2半导体材料,省去了传统试错所需的漫长周期。
转向生物学,Co-Scientist展现了对复杂生命现象的预测能力。面对工程化大肠杆菌在不同诱导剂(IPTG)浓度梯度下的群集运动表型,它仅凭稀疏的成像数据便做出预测,结果与未发表的湿实验形态学测量数据定量吻合。这意味着,它能从海量信息中捕捉到肉眼难以察觉的规律。
在计算机科学领域,Co-Scientist甚至自主发现了一种推理时扩展架构。这一架构在HealthBench(Hard和Professional)基准测试中,超越了六个前沿模型;在盲法医生评估中,它还有望减少潜在的临床危害。这不仅是性能的超越,更关乎医疗安全的提升。
最值得关注的是系统的可靠性。一项双盲研究邀请30位领域专家进行了450次评审,结果显示,Co-Scientist的可靠性模块能有效减少幻觉和抄袭现象,同时提升研究安全性。这意味着,AI生成的科学内容正变得更可信、更负责任。
这些成果共同指向一个未来:闭环驱动的多智能体科学AI,正在加速真实世界的科学发现。从假设到实验,再到论文,AI不再是旁观者,而是躬身入局的探索者。当机器的理性与人类的创造力交织,科学发现的边界将被重新定义——而这场变革,或许才刚刚开始。
想象一下,你正与一个AI助手对话,它既能依靠自身知识回答,也能随时调用外部工具获取最新信息。但麻烦在于,它常常在需要工具时犹豫不决,又在不需要时多此一举——每次多余的调用都意味着延迟、成本和潜在的副作用,而漏掉的调用则让它自信满满地给出错误答案。如何精准控制这个“工具开关”,成了大模型落地的一道坎。
过去,人们靠后期训练或精心设计提示词来改善,但既昂贵又难以在推理时动态调整。而一项新研究揭示了一个惊人的发现:这个“开关”竟藏在模型内部一条极细的“神经方向”里。研究者们从模型自身的工具偏好信号中提取出一条线性方向,不需任何训练,只在推理时轻轻施加一个强度系数α,工具调用率就能从接近0%平滑攀升到90%以上,且生成的调用依然规范有效。更妙的是,这个方向可以双向调节——调低它,模型变得“矜持”;调高它,模型会在那些它确实答不上来的问题上精准地“出手求助”。
这项方法不仅对已知工具有效,还能泛化到从未见过的工具,且不会特别偏袒某一种选择。在真实的工具执行环境中,仅用一次强度扫描,就能绘出一条成本与精度的帕累托前沿,将开放域问答的准确率从0.29拉升到0.56,近乎翻倍。更令人振奋的是,这一配方跨越了多种主流架构——密集模型、MoE模型、多模态模型——通通适用,全程无需任何训练。
这像是给大模型装了一个可微调的“工具直觉旋钮”。当调用与沉默的边界不再依赖庞大的训练成本,而只是模型内部一个可插拔的方向向量,我们或许正在见证一种更轻量、更可控的智能操作方式。未来,每一个AI助手都可能拥有一个精确的“行动力调节器”,在谨慎与果断之间,找到最佳的那个平衡点。
当大模型面对一道难题时,给它更多“思考时间”确实能提升表现,这正是所谓“测试时扩展”的魅力。但代价也很沉重:模型的每一步推理都像在纸上完整写下草稿,整段记忆都留在内存里,想得越久,账单越吓人。尤其碰上需要长考的高难度任务,光是保存中间推理过程就可能让算力成本高到难以承受。
然而,一篇最新研究却提出了一个反直觉的观察:随着模型持续推理,那些早先产生的中间思维标记,大部分变得不再重要。既然它们已经完成了历史使命,为什么还要让它们占据宝贵的内存?基于这个洞察,研究者设计出一种名为“前缀滑动”的机制——在推理过程中,果断丢弃那些既不属于前缀、也不属于最近几千个标记的中间内容。前缀负责保留关键指令和可用工具,而最近的标记则是模型当下正在推进的思路。这样一来,无论模型思考多久,内存占用都被限制在一个固定范围内,长时程的测试时扩展因此变得高效可行。
更令人惊喜的是,这项方法无需额外训练,就能让现有模型的推理速度提升三倍,同时保持原有性能。而如果配合强化学习进行训练,它还能进一步解锁超过十万个标记的推理轨迹,取得更加出色的结果。对比实验也显示,“前缀滑动”比“总结中间步骤”或“普通滑动窗口”都更有效。这项研究像是给“长跑型”大模型卸下了历史的包袱,让它们能更轻快地奔向更深的思考——也许未来的智能,不是记住所有走过的路,而是懂得适时放下那些已经不再重要的过往。
当AI代理还在云端奔跑时,一场悄然的反向迁徙开始了。Perplexity与Nvidia联手发布了名为Portable Computer的全新设备端AI代理,它不再将你的文件送往远方服务器,而是让一切计算发生在你的桌面硬件内部,并且完全免费运行。
这台“便携电脑”并不便携,它栖身于Nvidia售价4699美元的DGX Spark桌面超级计算机中,只需一次点击即可完成安装。用户可以在Qwen 3.8 27B和Perplexity自研的PPLX 27B之间选择本地模型,而当本地能力不足以应对复杂任务时,系统也能调用超过15种云端模型——但每次调用前都必须经过你的明确批准。这意味着,你的私人文件默认留在本地,云端只是偶尔的备选项,而非默认路径。
设备端的工作完全免费,不消耗任何积分,连接器还能与主流应用无缝集成。那些涉及敏感数据、隐私要求极高的任务,如今可以在不联网的情况下完成,像是给AI装上了一道物理隔离的保险栓。
这一发布时机耐人寻味。就在几天前,有报道称Nvidia正与Perplexity洽谈新一轮投资,金额高达数十亿美元,估值超过300亿美元。硬件巨头与AI新贵的紧密联手,让这次产品发布更像是一场战略宣言:未来的AI竞争,不仅拼模型大小,也拼数据主权和运行成本。
值得一提的是,Perplexity此前已将代理带到Mac平台,名为Personal Computer,但那依然依赖云端算力。Portable Computer的不同之处在于,AI的实际推理工作从云端转移到了本地硬件上,真正实现了从“租用智能”到“拥有智能”的转变。
随着更小、更高效的开源模型不断进化,这种本地优先的模式会愈发强大。前沿AI或许不再是日常依赖,而是关键时刻的增援力量。当你的AI不再需要把秘密讲给云端听,你与机器之间的信任,才真正开始建立。本地智能的浪潮,也许正在从这台小盒子开始,悄悄改变整个行业的游戏规则。
当大多数目光还停留在英伟达的GPU如何主宰人工智能世界时,OpenAI悄悄亮出了一把“辣椒”——代号Jalapeño的自研芯片。这颗芯片并非为了训练模型,而是专攻推理,也就是让AI真正“跑起来”回答问题的环节。根据OpenAI刚刚公布的首次基准测试结果,这颗与博通联手打造的700瓦芯片,在面对英伟达自家1200瓦的旗舰产品时,不仅没有怯场,反而给出了惊人的答案:响应速度快了最多3.6倍,每瓦功耗完成的工作量最多高出1.9倍。换言之,更少的电,更快的AI,这几乎击中了行业最敏感的神经。
更耐人寻味的是Jalapeño的诞生过程。OpenAI透露,他们动用了尚未发布的Astra模型和Codex工具来协助芯片设计,从最初图纸到具备制造条件只花了九个月——这个速度在芯片行业堪称闪电战。负责硬件的副总裁Richard Ho表示,OpenAI不会对外出售这颗芯片,因为内部“太需要它了”。即便如此,OpenAI在训练新模型的环节上,依然要依赖英伟达的GPU。也就是说,Jalapeño目前只负责“动脑”之后的那部分工作,而不是“学习”本身。
放眼整个行业,自研芯片的俱乐部正在快速膨胀。谷歌的TPU早就证明了实验室拥有自有硅片的甜头,如今Anthropic、亚马逊、微软也纷纷亮出各自的芯片计划。Jalapeño如果真的经得起大规模部署的考验,那么OpenAI将迎来几个立竿见影的变化:更低的token成本、更快的推理速度,以及一个完全围绕自家模型量身定制的设计闭环——每代新模型都能与芯片深度咬合,而不是被动地适配别人的硬件。
目前,Jalapeño的后续两代产品已经在路上,预计今年晚些时候进入OpenAI的数据中心,2027年逐步放量。这颗芯片究竟会不会成为AI推理时代的“持剑人”?至少从眼下的数据看,英伟达的宝座旁,已经多了一位攥着辣椒的挑战者。当算力的军备竞赛不再只靠堆料,而是开始比拼每瓦特的智慧,整个行业的游戏规则,或许正在悄然改写。
山姆·奥特曼终于给通用人工智能(AGI)定下了一个日期。在一篇《时代》杂志的深度专访中,这位OpenAI的首席执行官表示,一个符合他个人标准的AGI模型——能在几乎所有任务上与人类匹敌或超越人类——将在今年年底前在实验室内部诞生。
这并非孤立的豪言壮语。OpenAI的研究主管马克·陈给出了一个更量化的判断:实验室已经“走完了通往AGI的80%路程”。而联合创始人格雷格·布罗克曼则大胆猜测,未来人们回望这段时间,会将其视为AGI真正降临的时刻。
真正让业内人士侧目的,是首席科学家雅库布·帕乔基披露的细节。他提到,公司的Astra模型如今已能独立阅读一篇论文,并完成相当于研究员一周的工作量——这恰好达成了OpenAI在2026年实现“自动化实习生”的目标。这意味着AI不再是简单的问答工具,而开始扮演真正的初级科研助手角色。
奥特曼对Astra的期许更高。他称Astra将是第一个“以有意义的方式真正发明新事物”的模型,并直言创造新知识是“非常接近AGI的事情”。当模型不仅能处理既有信息,还能产出前所未有的洞见时,人类与技术的关系将进入一个无人涉足的领域。
《时代》的报道还回溯了今年七月发生的一起安全事件,OpenAI为此发布了更详尽的报告,并试图将重心重新拉回安全与放缓前沿模型竞赛之上。
AGI向来是个闪亮却定义模糊的词,各路人马各执一词。但OpenAI的这番表态,听起来像是一场正式宣言的前奏。相比“AGI”这个标签本身,帕乔基的自动化研究员里程碑和奥特曼的“发明新事物”论断,或许才是更值得细读的注脚——这些门槛一旦跨过,模型能力将真正踏入未知水域,而我们所有人,都是这场航行的乘客。
过去一周,一个名为Ox Alpha的匿名免费模型忽然席卷互联网,在OpenRouter平台上一举拿下使用量第一,数据翻倍于第二名DeepSeek,平台官方称这是有史以来最火爆的首秀。无数人猜测它的来历,有人说是OpenAI的测试版,有人说是谷歌的隐藏项目,甚至谷歌员工诡异的态度又给谜团添了一把火。然而猜来猜去,答案其实在最开始就被怀疑过的那位手里——中国AI实验室Z AI。
如今谜底正式揭晓:Ox Alpha正是Z AI新发布的GLM-5.3-Flash模型。Z AI不仅公开了模型权重,还把定价压到了极低——在Artificial Analysis的评测中,该模型以每个任务0.045美元的折扣价拿到了智能指数57分,价格比同等水平的竞争对手便宜约十倍。用行内话讲,这个智价比堪称降维打击。
更令人惊讶的是技术层面的细节。Z AI透露,Ox Alpha免费试用那一周,全部算力都跑在中国自研芯片上。他们声称这套纯国产芯片的推理系统,现在服务token的成本已经接近英伟达硬件的水平。如果属实,这意味着一件大事:中国AI产业链最被人担心的算力瓶颈,可能已经被松动了一个口子。
一个匿名模型引爆全球围观,最终发现是国产芯片加低价策略的组合拳。Z AI用一场漂亮的谜题营销向世界展示了两个事实:智能可以很便宜,国产算力也可以很能打。当推理成本被打到低谷,AI的普及门槛正在以超乎想象的速度崩塌。或许接下来的问题不再是谁能造出最聪明的模型,而是谁能把聪明变得最便宜。
当人们谈论智能体(Agent)的能力时,往往第一时间想到底层大模型。但一项新研究揭示了一个常被忽视的事实:智能体的表现并非由模型单独决定。承载记忆管理、规划策略、行动协议与工具调用的智能体“操控框架”,有时甚至比基础模型贡献更大。然而,这样的框架设计长期依赖人工、针对单一任务定制,从根本上难以规模化扩展。
为此,研究团队提出了JIT-Agent——一个专门训练出来的“操控框架智能模型”。它能把智能体操控框架形式化为一种可组合、可机器生成的构件,并遵循固定的四模块协议。JIT-Agent的核心本领在于:为手头任意任务即时定制框架,在运行中修复框架以保证稳定可靠,还能从过往大量框架配置中提炼性能信号,实现自我进化。
这项能力带来的提升相当直观:搭载JIT-Agent作为框架助手后,DeepSeek-V4-Flash在DeepSearchQA上超出GPT-5.6达9.1分,在OdysseyBench上超出4.3分;原本已很强的GLM-5.2也额外获得了最高20.2分的增长。在受控评测中,JIT-Agent生成的框架与成熟的智能体运行时OpenCode、Claude Code不相上下,并且对DeepSeek V4、Mimo-V2.5、Qwen3.6等多个尺寸的模型家族均有持续改进。
据研究者称,JIT-Agent是首个专为即时操控框架生成而设计的模型。它把“框架智能”确立为一个可训练、可迁移、可累积的智能体能力维度,与模型规模的扩展相互独立。换句话说,与其无休止地堆叠模型参数,或许我们该把目光投向那层连接模型与任务的“隐形骨架”——它可能才是让智能体真正聪明起来的关键。
想象一下,不同形态的机器人——机械臂、人形机器人、甚至人类的手——都能共享同一种“动作语言”来学习操作技能。长久以来,多形态机器人数据的异质性,就像不同方言之间的隔阂,让通用策略的联合学习举步维艰。传统方法要么依赖显式的动作重定向,要么生成人类到机器人的视频,或为每个数据集设计特定适应分支,这些做法都从根本上阻碍了统一策略的形成。
为此,研究者提出了一种名为UCAG-P的相机中心统一动作公式,从结构上将异构的具身数据集对齐到一个共享的几何动作空间。UCAG-P不再把机器人专属命令当作统一策略的学习目标,而是通过图像平面和相机坐标系中可观测的锚点运动来表示操作任务,把机械臂、人形机器人和人类双手都视为同一种动作模式的“不同化身”。一个几何条件化的动作翻译器,将预测的运动与目标机体的运动学相结合,生成可执行的控制指令。这种解耦的架构,让共享的视觉-语言-动作策略在学习可迁移的操作几何的同时,保留机体特定的可控性。
UCAG-P在4030小时机器人和仿真数据以及2340小时人类演示数据上完成训练。单个检查点在LIBERO上达到98.3%的成功率,在RoboTwin Easy和Hard上分别为88.7%和89.2%,在LIBERO-Plus上零样本达到82.0%,在RoboCasa GR-1上达到62.0%,且无需针对特定基准进行微调。
这项研究揭示了一个朴素而深刻的道理:当我们不再执着于每种机器人的“母语”,而是找到它们共同的身体几何规律,跨形态的智能或许水到渠成。数据的碎片化并非不可逾越,统一动作公式的钥匙,可能就藏在最朴素的相机视角之中。
在多模态检索的世界里,一种新的思路正在打破传统。过去,许多方法用固定数量的向量来表示每个样本,以为这样就能捕捉到跨模态的细节信息。但现实是,不同样本的检索需求各不相同,有些简单,有些复杂,用同样的容量去应对所有情况,难免顾此失彼。于是,研究者提出了“样本自适应多向量表示”——SAMVR,一种让表示容量随样本特性而灵活变化的新问题设定。
在这个框架下,每个样本不再被硬性分配相同数量的向量,而是拥有一个“内容自适应嵌入集”,其容量大小由这个样本在检索中额外向量能带来的实际效用决定。为了落地这一设想,研究者开发了AdaptiveEmbed框架,通过多组对比学习和对称的集合间相似度来学习结构化的多向量表示,同时引入效用策略优化,基于边际效用分配机制为每个样本量身定制合适的表示容量。
实验覆盖了图像、文本、视频和音频等多个模态的检索基准,结果显示,这种自适应容量分配比固定容量的多向量表示取得了更好的整体检索性能。这意味着,让表示容量“随需而变”,确实是提升多模态检索效果的可行路径。
不难看出,当技术开始尊重每个数据点的独特性,或许我们离真正的智能理解又近了一步。
Sam Altman终于给“通用人工智能”按下了一个具体的日期。在一篇深度专访中,这位OpenAI首席执行官放话:到今年年底,内部将会出现一个模型,达到他个人对AGI(在几乎所有任务上匹配或超越人类的人工智能)的定义标准。这不再是一个模糊的远景,而是一张贴在墙上的倒计时表。
OpenAI的研究主管Mark Chen更直接,他给出一个量化乐观:实验室已经走在通往AGI的路上“80%的路程”。而联合创始人Greg Brockman则做了一个大胆的预言,当未来的人们回望此刻,会意识到AGI正是在这个时期真正到来。三位核心人物,三种表述,指向同一个信号:那个曾被反复争论的“奇点时刻”,在他们眼中已经近在咫尺。
真正值得玩味的细节藏得更深。首席科学家Jakub Pachocki透露,他们的Astra模型已经能够独立拿到一篇论文,然后像一名研究员一样连续工作一周,完成一整段科研任务。这恰好命中了OpenAI在2026年实现“自动化实习生”的目标,而且进度似乎比预期更快。与此同时,Altman给Astra赋予了一个更耀眼的定义:它将是第一个“以一种重要方式真正发明新事物”的模型。在他眼中,生成新知识本身就是一种“非常接近AGI”的特质,这比单纯处理文本、图像或代码要沉重得多。
当然,这份豪言并非没有阴影。专访也披露了去年七月发生的一场安全事件,OpenAI随后发布了详细报告,并试图重新聚焦安全议题,放慢前沿模型的推进节奏。故事的另一面是:冲刺与刹车同时进行,而AGI的倒计时并不会因为安全考量而停下。
关于AGI的定义,人们至今无法达成共识,这个闪亮的术语更像是一面镜子,人人看到自己想要的答案。但无论定义为何,OpenAI显然准备抢先宣告它的到来。当自动化研究员开始独立产出知识,当模型开始“发明”事物,那些我们曾以为隔着千山万水的门槛,正在被悄然跨过。而门槛之后的领域,对于人类与机器来说,都是一片从未踏足的未知之地。
一个匿名免费模型Ox Alpha突然席卷互联网,在OpenRouter平台上一举登顶,使用量竟是第二名DeepSeek的两倍,被平台称为史上最火爆的首秀。整个AI圈都在猜测它的来历,有人怀疑是谷歌,有人猜是海外实验室,甚至谷歌员工还放出过烟雾弹。一周之后,谜底终于揭晓——中国AI实验室Z AI承认,Ox Alpha就是他们新发布的GLM-5.3-Flash模型。
更让人惊讶的是,Z AI不仅公开了模型权重,还把价格定得极低,只有顶级对手的零头。根据Artificial Analysis的评测,这个模型在智能指数上拿到57分,而每次任务成本仅0.045美元,比同级别对手便宜了整整十倍。
但真正重磅的消息藏在细节里:这一周的免费使用,全部跑在中国自研芯片上。Z AI声称,这套国产芯片方案已经能把服务token的成本做到接近Nvidia硬件的水准。如果属实,这意味着中国AI产业最关键的算力瓶颈,可能正被悄悄突破。
Ox Alpha的故事不仅仅是又一个AI模型的走红,它像一扇突然打开的窗户,让人看到另一个可能:当芯片不再是天花板,智能的定价权、供应链的主动权,或许都会迎来新的格局。而这场由匿名模型引发的狂欢,也提醒着我们——AI世界的下一次震惊,也许就藏在某个看似不起眼的权重文件里。
在人工智能的演进中,视觉推理一直是个难题。传统方法把图片和视频当作“输入素材”或“输出结果”,而一项名为VBVR-Pro的研究试图颠覆这一思路:让视觉生成本身成为推理的媒介——图像和视频不再是语言的附庸,而是解决问题的“第一公民”。
然而,这条路并不平坦。研究者们面临三大瓶颈:缺乏可扩展的训练任务、缺乏可靠的反馈信号、以及难以在不同生成方式间进行受控对比。为此,他们搭建了一个闭环测试平台,从三个层面破局。
第一,任务规模化。VBVR-Pro将视觉推理转化为一个包含300个程序化生成任务的受控任务空间。模型在此训练后,展现出强大的迁移能力,在RISE-Video、MME-CoF-Pro、BabyVision等七个外部视觉推理基准上表现亮眼,证明这些任务不是“纸上谈兵”,而是能触类旁通的实战训练场。
第二,可验证的奖励机制。研究团队为每个任务设计了基于确定性规则的奖励评分器,实现细粒度的任务评估。他们还系统考察了当下流行的“多模态大模型当裁判”范式,发现这种VLM-as-a-judge模式存在反复出现的失败案例。相比之下,基于规则的评分器与人类判断高度一致,并且能在大规模多任务强化学习中充当可靠的奖励信号——训练后的模型在各类视觉推理任务上性能更上一层楼。
第三,机制研究。平台支持超过30种图像、视频和交错生成器的受控对比实验。分析显示:对于需要持续追踪时空状态的任务,视频生成依然是最强选项;而交错式生成则提供了计算效率更优的替代方案。更关键的发现来自消融实验和探针分析——研究中隐约浮现出“视觉原生轨迹”的存在,这类轨迹对视觉推理至关重要,或许正是突破瓶颈的钥匙。
研究团队已公开全部数据、模型、评分器和代码,为后续探索铺平道路。当生成不再只是输出结果,而是成为一种思维方式,视觉推理的边界或许将被重新定义。真正的智能,也许就藏在那条无须语言中转的轨迹里。
计算机视觉领域正站在一个十字路口:当语言模型凭借Transformer架构和互联网级文本数据横扫千军时,以图像、视频和几何为输入的视觉智能,能否同样孕育出通往通用人工智能的火种?
这篇来自多位不同立场与机构学者的联合思考,提出了一个大胆的概念——视觉通用智能。它无意给出一个标准答案,而是试图厘清在AGI时代,计算机视觉究竟应当追求怎样的原则。从语言模型的成功经验出发,研究者们看到一条清晰的逻辑链:大规模自回归建模加上激进的规模扩展,让GPT系列在未见过的任务上展现出惊人的迁移能力。那么,如果视觉模态也遵循相似的规律,是否也能激发类似的智能涌现?
问题的关键不在于为视觉智能下一个唯一定义,而在于探索几个根本性的议题:视觉作为核心智能来源,应处理哪些输入模态?如何构建真正考验智能的基准测试?学习范式应当如何设计?以及与语言等其他模态的关系又是怎样?这些问题交织在一起,构成了VGI研究的基本框架。
文章没有给出确切的答案,但它暗示了一个可能性:视觉不仅仅是为语言模型提供附庸的“眼睛”,而可能是一条独立且深刻的智能路径。当语言试图描述世界时,视觉早已在无声地理解世界。在通往AGI的征途上,我们或许需要更多这样的反思——智能的形态是否被我们过早地限定在了文本的疆域里?对于机器而言,看见,或许不只是识别,而是一种更原始、更本质的思考方式。
想象一下,你从未教过机器人如何“把积木放进盒子里”,但只需给它看一段人类演示的视频,它就能照着做。这听起来像是科幻,但一项新研究正把这种能力变成现实。长期以来,机器人学习的一大难题是“跨任务泛化”——训练时见过的任务可以完成,一旦遇到全新任务,往往就束手无策。大型语言模型给了研究者灵感:它们无需更新参数,只要在上下文中给出任务描述,就能执行从未见过的新任务,这就是“上下文学习”。于是,一个问题浮现出来:对机器人操作而言,最自然的“任务描述”是什么?答案不是语言,而是人类视频——视频里包含了任务如何演变的丰富视觉线索。
基于这一思路,研究者提出了Zero-WAM,一个因果视频-动作模型。它通过观察人类视频指令,就能执行训练时从未见过的操作任务。但实现这个目标有个现实障碍:同时包含人类演示和机器人操作的配对数据极其稀缺。为此,研究团队设计了一条自动化流水线,把任务采样的机器人轨迹自动转换成语义匹配的人类视频,构建出包含8.6万个任务、7.42万对人类-机器人上下文学习配对的数据集HumanGen。为了让模型真正从视频提示中提取任务信息,而不是偷懒走捷径,他们又提出了一种名为“上下文未来块预测”的训练目标,有效抑制了模型从已见任务中学到的捷径,迫使它把注意力放在视频指令上。
效果如何?在RoboTwin 2.0模拟环境的七个全新任务中,Zero-WAM达到了47.0%的平均成功率,比最强的视频-动作基线方法高出了29.5个百分点。在真实世界的评估中,它也能跟随人类视频引导,成功泛化到多物体场景、长时程操作和精细插入等未见过的任务配置。这项研究的意义在于,它把机器人泛化问题变成了一个“任务描述”问题——只要把人类视频当作一种强大的任务规范,机器人就能举一反三。或许未来,教机器人做事就像给朋友发个视频那么简单,而每一个演示片段,都可能成为机器人的新技能钥匙。
想象一个世界模型,它不仅“看见”万物如何变化,更“懂得”变化背后的规则。现有视频类世界模型,大多只从视觉画面里学习动态——它们看到苹果落地,却不知道万有引力;看到日出日落,却不懂地球自转。这种仅靠“看”的学习方式,让模型难以维持长期一致的变化,也无法支撑开放式的世界演化。如今,一项名为“Code World Model”的新框架,尝试为世界模型装上“代码大脑”,让AI从“预测画面”转向“编写规则”。
这个框架的核心思路很巧妙:把“世界如何演化”和“画面如何呈现”彻底分开。语言模型扮演“世界大脑”,负责推理事件与因果,并生成可执行的代码,来持续记录世界状态、推进符合规则的演化。而视频模型则扮演“视觉画师”,负责将状态渲染成逼真的画面。但难题在于,代码状态和图像之间隔着一条鸿沟。研究团队引入了一个“代理表征”(proxy representation),将每一帧中的时空约束编码成一种可编译的“代理视频”,视频模型再根据这份规格说明书,生成高保真的视觉画面。
为了让这套系统真正运转,他们还搭建了数据流水线,从游戏实录和真实世界视频中,构建对齐的“代理—观测”数据对。经过配对游戏数据的微调,模型MiniMax-H3能够遵循代理生成的时空规格,在由代码代理搭建的简单交互世界中,生成既符合规则又保留丰富细节与动态的画面。实验结果表明,将代码的持久化世界演化能力,与视频模型的灵活视觉呈现能力相结合,是一条通往开放式世界模型的可行新路径。
或许未来的世界模型不再只是“眼见为实”的模仿者,而是能像程序员一样,编写出万事万物运行脚本的创造者。世界不再是模糊的像素流,而是一部可调试、可扩展的代码史诗。
机器人推理新招:语言引导操纵原文
当大语言模型学会推理,人们首先想到的是解数学题、写代码。但这项能力能否延伸到物理世界,帮助机器人完成复杂操作?答案似乎正在被改写。一篇来自研究团队的最新工作,提出了一个名为R3的简单后训练方法,让现成的视觉语言模型(VLM)变身“机器人推理器”,用自然语言直接指导底层操纵策略。
过去,机器人学习大多依赖“指令-模仿”模式:给机器人看示范,让它照着做。但面对长时程任务——比如整理货架、打包杂货——机器人需要追踪进度、理解物体关系、从错误中恢复,还要驾驭充满噪声的低层策略。单纯模仿往往力不从心。R3的思路则截然不同:它让VLM先生成专家风格的推理轨迹,再用基于评分规则的强化学习离线优化推理器,最终让模型产生自由形式的语言推理,在测试时实时引导动作。
在Language Table和模拟双臂杂货打包这两个受控测试平台上,R3展现出显著优势。相比只靠指令模仿学习的基线,R3在未见任务上探索更充分、泛化更强,表现大幅领先。研究者的分析还暗示,自由形式的语言推理可以充当一种“测试时计算”机制,帮助低层策略避开歧义、做出更明智的决策。
这项研究的妙处在于,它没有重新设计复杂的网络结构,也没有依赖昂贵的真实机器人数据,而是巧妙地利用了VLM已有的知识和推理潜力。就像给机器人装上了一副“思考的眼镜”,在动手之前先想清楚步骤、预判困难。这或许预示着,语言不只是人与机器人的交流工具,更可能成为机器人自身规划与纠错的内部思维语言。未来,当机器人在厨房里从容地准备晚餐时,它的“内心独白”也许正是源于这样一段训练出来的推理能力。
想象一个机器人正在学习操控物体,它不仅要预测画面下一秒的变化,还要决定如何行动。世界动作模型正是将这两者融合,用视频动态作为表征学习的信号,让机器人在预测未来的同时学会操控。然而,这类模型的视频潜在表征主要服务于视觉预测,并未被明确鼓励去保留多视角间的几何结构,或是空间上局部的、与物体相关的语义信息。这就像一个人虽然能看懂画面,却对物体之间的空间关系和细节语义缺乏感知。
为了解决这一问题,研究者提出了GaussianWAM,一个在训练阶段增强表征的框架,巧妙地将几何与语义监督组织在一个三维高斯场中。具体来说,给定同步的多视角观测,冻结的几何和视觉基础模型会提供深度、相机参数以及密集语义特征。GaussianWAM将这些异构信号绑定到共享的高斯原语上,渲染出空间对齐的语义、深度和覆盖目标,再将这些目标蒸馏进世界动作模型当前观测的表征中。整个过程完成后,所有教师模型、高斯组件和辅助预测头都会被移除,留下的是原本的推理路径,无需增加任何额外模块或计算量。
实验数据令人印象深刻。在LIBERO-Plus基准上,GaussianWAM将FastWAM的性能从52.05%提升至71.29%,将Cosmos Policy从71.52%提升至77.30%。值得注意的是,仅仅直接蒸馏CLIP和VGGT特征,就已经能建立起69.37%的强基线,而通过高斯场的统一组织,成绩进一步提升到71.29%。这有力地证明了将异构教师信号进行空间组织的价值。此外,该方法在标准LIBERO上也带来了性能提升,并在RoboTwin和真实世界操控任务中展现出积极的迁移趋势。
这些结果指向一个务实的路径:在训练阶段通过三维高斯蒸馏注入几何与语义相关的监督,不必改变部署时的架构,就能显著增强世界动作模型的表征能力。或许,未来的机器人学习,正是在这种看不见的“场”中,悄然构建起对物理世界的更深理解。
想象一下,你每天上班都要重新摸索路线,哪怕已经走了上百遍。这正是当前许多智能体在规划动作时的真实写照:它们拥有强大的“世界模型”——一个能把图像像素转化为抽象潜在表征的编码器,但每次面对新的状态和目标,却仍要从零开始,反复迭代优化动作序列,把世界模型当作一个黑盒模拟器来“试错”。每重新规划一次,就要支付一次昂贵的迭代优化成本,过去积累的规划经验完全派不上用场。
那么,能不能在世界模型学会之后,把规划这件事本身也“摊销”掉?LeFlow给出了肯定的答案。它像一个聪明的老司机,在世界模型的潜在动力学空间中,学习了一个可复用的潜在轨迹先验。具体来说,LeFlow把规划重新定义为条件式潜在轨迹生成:一个修正流模型(rectified-flow model)在当前的潜状态和目标潜嵌入之间“想象”出一条未来的潜路径;接着,一个逆动力学解码器把这段潜路径上的动作变成连续的动作块;最后,被冻结的世界模型通过自回归滚动评估每个候选方案,就像考官一样严格把关。
在四个主流的以目标条件为驱动的像素控制基准测试中,LeFlow彻底告别了传统“动作空间里的迭代优化”,改用摊销式的潜规划加固定预算的滚动选择。结果令人印象深刻:成功率稳定提升,而规划时间却降低了一个数量级。这不仅是一次速度的胜利,更启示我们——潜在世界模型的价值不应止步于“预测未来”,它还能孕育出可复用的规划先验,让智能体真正学会如何高效地“思考下一步”。也许,通往通用智能体的路上,缺的不是更快的搜索,而是一个能“凭直觉”规划的大脑。
一场无声的攻防战正在数字世界的阴影中加速演变。台湾研究机构TeamT5在最新的报告中揭示了一个令人侧目的趋势:中国关联的黑客组织在将DeepSeek等开源AI模型纳入攻击工具包后,其发动的网络攻击次数比此前翻了一倍还多。
这些黑客组织为何偏偏选中DeepSeek?TeamT5首席分析师Charles Li给出了直白的答案:“DeepSeek是中国黑客的首选AI,因为它相对强大,且网络防护护栏极低。”在成本与安全约束的天平上,DeepSeek以低廉的价格和宽松的规则限制,成为了攻击者眼中的“趁手工具”。相比之下,像Kimi K3这样定价更高的模型,至今尚未在攻击活动中被研究人员捕获。
报告披露了这些黑客组织的具体作案手法:利用DeepSeek编写入侵代码,成功攻破一家台湾企业的电子邮件系统,并通过分析上千个IP地址来精准测绘攻击目标。这些案例表明,开源AI的赋能已不再是理论上的担忧,而是正在发生的现实威胁。
值得警惕的是,这场技术军备竞赛的节奏正在加快。英国AI安全研究所早在五月就发出警告:AI的网络攻击能力每隔几个月就会翻一番。如今,攻击次数的倍增似乎正在与AI能力的跃升同步发生。当人们的目光聚焦在顶级闭源模型如Mythos可能带来的风险时,那些便宜、可下载、防护更少的开源模型,或许才是更难解决的安全难题。
技术本身并无善恶,但它的易得性与低门槛,正在让网络世界的攻守平衡变得更加脆弱。当一把智能的钥匙可以轻易落入任何人之手,锁匠与盗贼之间的赛跑,恐怕才刚刚进入下半场。
在AI浪潮席卷全球的当下,许多企业选择直接租用现成的顶级模型,但法律信息与新闻业的百年巨头Thomson Reuters却走了一条截然不同的路。他们耗费两年时光、投入四千万美元,并非从零开始,而是巧妙借助了阿里巴巴开源的Qwen模型作为底座,用自家数十年的独家内容精心调教,最终训练出了第一个完全属于自己的AI模型。
这笔账看似惊人,却藏着精明的算盘。四千万美元,对普通公司而言是天价,但对这个长期依赖昂贵商业API的庞然大物来说,不过是相当于以往一年多的账单。更令人惊叹的是,最新一轮训练成本已骤降至45万美元,AI训练的门槛正在以前所未有的速度降低。内部基准测试显示,这个名为Thompson的模型在某些领域竟超越了Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5等明星产品——尽管目前还仅限于内部测试。
Thomson Reuters的首席技术官Joel Hron用一个精妙的比喻解释了为何要如此大费周章:租AI就像租房子,每月付了钱,却永远无法累积成属于你自己的资产。他们追求的是那种能随时间复利增值的"权益"。这个选择背后,是一场关于AI时代核心资产的深层思考:当你的知识库本身就是最稀缺的资源,为什么还要把钥匙永远交给别人?
目前,这个模型仅覆盖了公司全部内容库的不到10%,研究用的开放权重版本也已计划发布。这或许只是一个开始,但它向所有拥有深厚内容积累的企业发出了一声意味深长的叩问:当训练成本日益亲民,强大的开源底座触手可及,是继续为别人的房子付租金,还是咬紧牙关,盖一栋真正属于自己的楼?答案,也许正在改写AI应用的商业逻辑。
2025年,当人们还在为地面AI数据中心的耗电量和散热问题争论不休时,SpaceX突然投下了一枚重磅炸弹——它宣布将基于英伟达最新的Vera Rubin NVL72机架系统,打造名为"Starmind"的太空数据中心,并计划在明年第四季度将一台瘦身版的系统送入轨道。
这套系统有多强悍?每个机架集成了72颗芯片,它们协同工作,相当于一台巨型计算机。英伟达方面表示,单颗芯片的算力是上一代H100的25倍。更令人惊讶的是,马斯克透露,太空版本经过特殊改造,比地面常规硬件"更简单、成本更低、密度更高、重量更轻",同时还针对太空中严酷的辐射和散热环境做了专门优化。
马斯克一直称Vera Rubin是"最好的AI计算机",而SpaceX据称将把从Grok大模型到轨道舰队管理的全部计算任务,都押注在英伟达的这套系统上。这意味着,未来的太空探索和AI训练,可能都在太空完成。
当然,成本是个绕不开的话题。分析师估算,目前轨道计算的价格是地面计算的4倍以上。但马斯克却信心满满,他认为这个差距会在未来几年内逆转,太空计算将变得比地面更便宜。
有意思的是,今年早些时候,OpenAI的首席执行官萨姆·奥尔特曼还曾公开吐槽太空数据中心"荒谬可笑"。但现在,随着SpaceX等公司加速推进,这个曾被嘲笑的设想正在快速变成现实。地面AI基础设施的建设正遭遇前所未有的批评和瓶颈,从能源消耗到环境争议,负面声音越来越多。对那些希望继续推动AI规模扩张的人来说,轨道解决方案来得再及时不过了。
当人类把最先进的算力送上星空,AI的边界也随之拓展。或许有一天,我们抬头仰望时,那些闪烁的"星辰"中,就有AI在默默思考。而这场关于算力、成本与未来的竞赛,才刚刚拉开序幕。
当AI代理还在云端争抢算力时,一场关于“隐私与成本”的变革正在悄悄落地。Perplexity与英伟达刚刚联合发布了一款名为Portable Computer的新设备端AI代理,它不再依赖云端,而是直接把AI工作装进你的硬件里。这意味着,你的文件、对话和任务处理都能留在本地,彻底告别上传服务器的担忧。
这套系统最吸引人的地方在于灵活性:用户既可以选择开源的Qwen 3.8 27B模型,也可以使用Perplexity自家的PPLX 27B模型,两者都能在本地流畅运行。如果遇到更复杂的任务,系统还能调用超过15种云端模型作为后备,但每次调用都必须经过你的批准。换句话说,你的数据大门只有你自己能打开。
更让人心动的是,所有本地处理都不消耗任何积分,还能与主流应用无缝连接。安装过程也极其简单,只需一次点击,就能在英伟达售价4699美元的DGX Spark桌面级“超级电脑”上运行。虽然目前仅限于这台高端设备,但官方透露,未来部分PC也能加入支持行列。
这款产品的出现,正值一个微妙的节点。就在发布前几天,有消息称英伟达正与Perplexity洽谈新一轮投资,金额高达数十亿美元,估值超过300亿。这桩合作显然不只是技术层面的联动,更是双方在AI布局上的一次深度绑定。
此前,Perplexity已经通过Personal Computer把AI代理带到了Mac上,但Portable Computer的意义在于,它把真正的AI计算从云端搬到了本地硬件上。随着小而精的开源模型不断进化,云端大模型或许会从日常主角变成偶尔救场的备胎。这既是一次隐私的胜利,也是一次成本的解放——AI的未来,或许不在遥远的服务器机房,而在你桌面上那台安静运转的机器里。当数据不再需要远行,当计算不再依赖云端,个人AI的边界正在悄悄改写。
想象一个智能体要完成一项漫长的任务,就像一位厨师准备一顿几十道菜的晚宴。随着时间推移,每一道菜的做法、火候和调味都成了记忆中的一部分,但如果每次做新菜都要翻遍所有历史记录,效率会急剧下降,甚至会忘记当下做到哪一步。这正是人工智能在长时程任务中面临的困境——历史信息越积越多,任务状态被淹没,技能调用也变得错位。
Recuris架构提出了一种全新的解决方案:将记忆分为“工作记忆”和“经验记忆”。工作记忆像一张临时便签,实时追踪任务进度,并据此从经验记忆中挑选最合适的技能;经验记忆则像一本不断更新的菜谱,存储着经过验证的操作技巧。这种耦合设计让智能体不再需要翻阅全部历史,而是聚焦当前需求,同时把执行过程转化为结构化证据,一旦出错,能快速定位到是哪个记忆环节出了问题。
更巧妙的是,Recuris构建了一个有边界限制的递归记忆进化循环:一个固定的元智能体(Meta-Agent)分析执行中产生的证据,对技能记忆进行局部、经过验证的更新,这些更新又重塑后续执行,产生新的证据,如此循环往复。整个系统不是无限膨胀,而是保持在一个可控的范围内持续优化。
在四个长时程基准测试和十个模型的实验中,Recuris在37个完成的模型-基准组合中提升了其中35个任务的成功率,将前沿模型推向了新的高度。例如,在tau-bench上,它为GPT-5.6 Sol增加了17.8个百分点,为Claude Opus 5增加了15.6个百分点,将Opus 5的成功率提升至87.9%;在SkillFlow上,Qwen3.6-27B和35B分别提升了16.6和13.5个百分点。随着任务交互时长的增加,优势更加明显——在最长任务上,Recuris带来了32.2个百分点的提升,常见的长时程失败率下降了最多80%。
这些数字背后是一个更深刻的启示:当智能体能够将积累的经验不断转化为更高效的长时程行为时,递归自我改进就不再是空中楼阁。它意味着,AI的成长不必依赖无穷无尽的扩展,而是可以通过精炼记忆、聚焦当前、循环验证,在既有的历史中不断汲取力量。真正的进步,往往不是记住更多,而是学会如何忘记那些不再重要的,并让每一次经验都成为下一次行动的阶梯。
在人工智能的世界模型训练中,海量视频数据是宝贵的燃料,而互联网上丰富的游戏实况视频,因其多样的环境和复杂的交互,成为极具潜力的训练来源。然而,一个隐藏的障碍始终存在:游戏画面中密密麻麻的界面元素——血条、地图、技能栏——这些屏幕上的“杂质”与游戏世界本身纠缠在一起,引入了与物理规律无关的噪声,严重干扰了模型对真实动态的学习。
为了攻克这一难题,研究团队提出了一个名为GameUI-Taxonomy的分类体系,并构建了一套名为G2WEngine的全栈工具链。这套工具的精妙之处在于,它能自动从真实游戏视频中提取可复用的UI组件,并将其合成到干净的画面上,生成时间上连贯的UI叠加层。基于这个引擎,团队构建了名为Game2World的大规模数据集,其中包含9.6万段合成的成对视频,并提供了精确的重建目标;同时还包括来自303款游戏的1079段真实场景视频,用于评估模型在复杂环境下的表现。数据集的资产库则收录了从1010个代表性游戏画面中提取的5132个经过验证的UI元素,覆盖了21个分类类别。
在此基础上,团队推出了GameCleaner——一个无需掩码的游戏界面去除模型。与依赖分割掩码的传统方法不同,GameCleaner结合了多模态语义理解与视频编辑能力,能够直接识别并移除各类HUD元素,同时保留底层场景内容和时间动态。在受控试验中,使用去除UI后的视频训练世界模型,整体VideoReward评分比使用原始带UI视频训练的模型提升了6.83%。在专门的界面去除评测中,GameCleaner在合成视频上的平均AAR(准确率)达到95.36,比最强的时间掩码基线高出57.3%;在真实视频上则取得了80.05的最佳AAR,同时保持了99.8%的背景完整性。
这些数字背后,是研究团队对“如何将互联网上海量游戏视频转化为高质量世界模型训练数据”这一规模化路径的有力探索。当游戏世界的边界被清理干净,模型看到的不再是混乱的符号叠加,而是背后那个连续、可预测的物理空间。或许,这正是迈向更强世界模型的关键一步——先学会忽略无关的干扰,才能看见真正的本质。
在智能体决策的幕后,世界模型正悄然成为越来越重要的角色。它被用来当“学习模拟器”,替AI在想象中预演未来,从而评估和改进策略。然而这一切都建立在一个未被验证的假设之上:模型对未来场景的预测,真的能忠实反映任意给定的动作吗?现实中,绝大多数评测只覆盖专家示范,一旦动作偏离常规,模型能否跟得上,至今是一笔糊涂账。
为了填补这一空白,研究者提出了WorldEcho。它把测试范围扩大到了更广阔的动作分布,并借助视觉完整性和SE(3)轨迹对齐这两把“尺子”,细致衡量世界模型对动作的响应能力。诊断结果引人深思:面对专家的动作,当前世界模型还算可靠,而一旦遇到五花八门的非专家轨迹,它们就明显露怯——要么对指令动作视而不见,要么干脆生成视觉上乱七八糟的未来帧。这样的模型,作为通用模拟器的可信度难免让人捏一把汗。
为了让世界模型真正“听懂”动作指令,研究者进一步提出WorldSync,在三个互补方向上协同发力。首先是分布覆盖:拓宽训练样本中动作后果的分布范围,让模型“见多识广”;其次是表征基础:借助一个被称为Action-Forcing Expert的机制,将中间视频表征锚定于由动作引发的真实机器人动力学上;最后是干预效果对齐:确保在动作干预下,模型预测产生的变化与真实未来中观测到的变化保持一致。三条路径相互补充,如同为世界模型装上了更敏锐的“耳朵”、更踏实的“根基”和更精准的“因果扳机”。
在RoboTwin基准测试以及真实机器人任务中,WorldSync带来了令人振奋的结果:它显著提升了WorldEcho的各项评估指标,也让世界模型成为迭代策略改进中更可靠的“陪练”。最终,智能体在真实任务中实现了更高的成功率。
这项研究提醒我们,衡量模拟器好坏的标尺其实就藏在对动作的“忠诚”里。对未来的世界模型而言,看得见未来固然重要,更关键的是,别歪曲那通向未来的每一步指令。唯有既能听清、又能跟紧每一个动作,模拟世界里的千里之行,方能始于足下、抵达彼岸。
在语言模型预训练的迷宫中,研究者们长期被一个现象困扰:学习率与参数范数,这两个看似独立的旋钮,究竟如何共同操控损失曲线的起伏?一篇新研究揭开了其中的深层机制——两者并不各自为政,而是通过它们的比值,即“有效学习率”(ELR),联袂主导一切。
故事始于一个大胆的实验:当研究者将不同的学习率和参数范数组合,却刻意让它们的比值保持一致时,奇迹发生了。原本分道扬镳的损失轨迹,竟在整个训练过程中高度重合,仿佛被同一只手牵引。即使个别运行采用截然不同的学习率和参数范数,只要ELR相同,损失曲线便如孪生兄弟般并肩前行。这种“ELR坍缩”(ELR collapse)现象并非偶然,而是在多种优化器、模型架构、数据集和模型规模下反复上演。平均坍缩误差通常仅有10的负三次方量级,甚至低于同一配置下不同随机种子之间的自然波动。换句话说,ELR的预测力比随机性本身还要精确。
研究者进一步通过系统性消融实验,锁定了影响坍缩精度的两个关键因素:归一化设计,以及学习率与范数变化的时间尺度。这意味着,并不是所有设置都能完美体现ELR的作用,某些设计会让轨迹略显松散,但核心规律依然清晰。更有趣的是,当研究者主动施加权重衰减或调整参数范数约束时,他们发现这些干预手段并非直接重塑损失曲线,而是通过改变ELR的调度来间接发力。这就像调音师并不直接拨动每根琴弦,而是调整整个乐团的指挥棒节奏。
这一洞察催生了实用工具:用ELR替代传统学习率,可以让一个拟合好的函数缩放律(FSL)在不同范数控制方法之间自由迁移。原本需要分别校准的经验公式,如今有了统一的坐标轴。ELR还解释了一个长期困扰学界的怪象——延迟加速(delayed acceleration),即参数范数控制有时会推迟损失下降的加速节点。在ELR的透镜下,这不过是调度曲线形态的必然结果。
这场发现将学习率调度、参数范数控制和损失动态串联成一幅自洽图景。它提醒我们,高维优化中看似独立的旋钮,可能只是同一个底层变量的不同投影。当你找到那个真正的公共坐标,许多混沌的表象便会自然归位。对于大模型预训练的实践者而言,ELR或许是那把尚未被广泛握住的钥匙。
在大语言模型的后训练阶段,两种范式逐渐占据主流:一种是基于可验证奖励的强化学习,它用任务级别的成败信号来引导模型;另一种是同策略蒸馏,它提供密集的逐词指导,却对生成轨迹的对错浑然不觉,最终只能逼近教师模型的水平。聪明的做法是把两者结合起来,让蒸馏提供细粒度监督,让强化学习提供任务正确性。但现有的融合方式往往依赖加权或启发式切换,引入一堆额外超参数和权衡。
一项新研究提出了OPDVR,即“带可验证奖励的同策略蒸馏”。它先根据轨迹正确性重新定义采样词元蒸馏的隐式奖励,再用一个ReLU门控机制,让正确的轨迹获得非负奖励,错误的轨迹获得非正奖励。这样一来,蒸馏信号既与任务成功对齐,又保留了教师模型的分布指导。更妙的是,这个改动把采样词元蒸馏变成了一种真正的可验证奖励强化学习方法,可以直接搭配任何策略梯度算法,比如GRPO。在六个推理基准上,OPDVR始终优于标准同策略蒸馏,而无需增加任何超参数。
这项工作的意义在于,它不止提供了一种更优的训练方案,还展示了一个思路:将两种看似互补的信号,通过巧妙的奖励重塑,消除调参负担,让模型在推理时既听得进老师的话,也看得清对错的路。当稀疏的任务级反馈和密集的标记级指导不再互相妥协,后训练的天平或许能真正实现双赢。代码已经开源,等待着更多探索者去拨动下一个齿轮。
当AI代理还忙着把数据送上云端时,Perplexity和英伟达悄悄换了个方向——把AI的工作搬到你的电脑上。他们刚刚推出了名为Portable Computer的本地设备端代理,承诺文件私密、无需联网,还能在英伟达的DGX Spark消费级硬件上免费运行。
这枚"便携电脑"并不像名字听起来那样是个硬件,而是一个可以装在本地的人工智能代理。用户可以选择Qwen 3.8 27B或Perplexity自家的PPLX 27B作为本地模型,遇到复杂任务时,也能按需调用超过15种云端模型——不过每一次云端请求都需要用户点头同意,本地的运算则完全不消耗任何积分。
安装方式简单得惊人:在售价4699美元的英伟达DGX Spark桌面超级计算机上,一键即可完成。未来,部分普通PC也能运行它。英伟达与Perplexity的关系显然不止于此——就在发布前几天,有消息称英伟达正洽谈以超过300亿美元的估值,向Perplexity投资数十亿美元。
Perplexity此前已经把代理带到了Mac上,名为Personal Computer,但Portable真正让AI的算力从云端下沉到硬件本身。这是一次关于隐私与成本的豪赌:当小型开源模型越来越强,前沿大模型或许会退居二线,从默认选项变成偶尔动用的备用工具。
本地AI的种子已经种下,未来你还会把每个问题都交给云端吗?
在人工智能竞相追逐“下一个词”的时代,加州理工学院教授阿尼玛·阿南德库马尔和工程师贝内迪克特·耶尼克却选择了一条截然不同的路。他们刚刚创立了初创公司Accelerated Understanding,目标是训练AI预测物理世界如何演变,而不是预测下一个单词是什么。
这两位研究者原本可以拿到杰夫·贝索斯旗下人工智能公司Prometheus的高管职位,以及35%的公司股份——那意味着来自全球最富有者的巨额财富。但他们拒绝了。这个决定后来显得更加惊人:Prometheus已经筹集了120亿美元,追逐着类似的目标。放弃如此可观的一笔股份,背后是他们对技术路线的坚定信念。
他们的AI模型没有沿用传统的Transformer架构,而是基于“神经算子”设计。这是一种基于物理学的方案,能够在三维空间和时间中追踪事件的演变,而非像大语言模型那样仅处理文本序列。在一项测试中,他们的模型单次运行处理了5万亿个数据点,大约是谷歌和Anthropic顶尖模型处理量的500万倍——这个差距令人咋舌。
Accelerated Understanding目前瞄准的商业方向包括芯片材料研发、极端天气预测和机器人技术。与许多押注于消费者端大模型的AI公司不同,他们更专注于企业级应用。在他们看来,物理AI竞赛正在升温,多个实验室都押注“世界模型”,但阿南德库马尔和耶尼克认为,真正的答案不是文本或视频,而是物理学本身。
放弃贝索斯的橄榄枝,押注一种完全不同的AI范式,并且用惊人的数据规模证明其潜力——这不仅是技术选择,更是一场豪赌。当大多数AI公司都在教机器读懂语言时,他们选择教会机器理解世界运行的基本法则。也许,预测飓风比预测一个句子更具价值,而他们正用行动证明这一点。