EZ.AI Listen Daily

全球AI新闻,耳听为快
2026年8月4日

在搜索引擎和检索增强生成技术不断演进的今天,如何让机器更聪明地理解查询与文档的语义,始终是一个核心挑战。传统的稀疏检索虽然高效,却常常困在字面匹配的局限里;后来出现的稠密检索捕捉了语义,却牺牲了可解释性和精确性。人们尝试用学习式稀疏检索突破瓶颈,但现有方法大多绑定在编码器结构上,面对文本与图像混合的多模态场景,更是不得不额外挂载复杂的跨模态模块。

一项新研究给出了一个截然不同的答案。研究者推出了UEmbed——一个纯解码器架构的多模态嵌入模型,却在一次因果前向传播中同时产出两种表示:稀疏的词级权重和稠密的语义向量。它的做法颇为巧妙:在输入末尾拼接N个可学习的特殊令牌,并将词表划分为N个互不重叠的子集,每个令牌负责自己子集的稀疏权重预测,最终拼接成完整的稀疏向量。这种设计让UEmbed不再依赖编码器,也无需附加任何跨模态辅助模块。

模型在公开数据上完成训练,并发布了2B、4B和9B三个规模。其中最大的UEmbed-9B在MMEB-v2基准上取得了71.8的稠密分数和71.0的稀疏分数,超越了同样使用公开数据训练的现有多模态嵌入模型(如RzenEmbed)。在经典的BEIR检索评测上,UEmbed同样能与强力的稠密和稀疏基线抗衡。更值得关注的是,研究者从有效性、效率和智能体应用三个维度验证了它的实用价值。

这项工作的意义不止于性能数字。它展示了一种新的范式:一个模型,一套参数,同时承担稠密与稀疏检索的双重职责,并把稀疏检索的边界从纯文本自然延伸到图文混合输入。对于那些既需要精确关键词匹配、又渴望语义理解的真实场景,这样的统一或许意味着更简单的系统架构和更灵活的部署方式。当检索模型学会在同一个大脑里同时思考字词与意义,下一步的想象空间将被彻底打开——我们正在见证嵌入技术从“分流”走向“汇流”的转折点。

2026年8月4日

智能体接到一个复杂的长期任务时,就像走进一座没有地图的迷宫。每一步都需要思考、调用工具、修改方案,而这些过程全都堆叠在同一段不断膨胀的上下文之中。任务进度越来越难追踪,更糟糕的是,它对自己完成情况的错误判断会像滚雪球一样,把后面的决策一步步带偏。面对这样的困境,一项新的研究给出了一个干脆的答案:别再把所有东西都往上下文里塞了,把任务状态单独拿出来管理。

这项研究将长期执行重新定义为一个“任务状态管理”问题,并提出了名为LongHorizon-Harness的新架构。它的核心思路非常直接:任务状态不再藏在执行过程中,而是被明确地保存在执行流程之外,并且只根据从环境中独立验证过的事实来更新。换句话说,智能体不再自己说了算,而是让环境来当裁判。

这个架构的核心是一个叫做“管理-执行-审计”的循环,三个角色各司其职。管理者负责维护任务状态,并决定接下来该做哪个子任务;执行者拿到一个干净的新上下文,专注执行当前这一步,不被历史信息干扰;审计者则只读环境状态,验证刚才的操作是否真的产生了预期变化,验证通过后,才能进入下一轮。这种“做完一步,验一步”的节奏,避免了错误自我评估的累积。

为了兼容不同的模型和框架,研究团队还设计了一个轻量的AgentAdapter,就像转换插头一样,让各种模型和智能体工具箱都能无缝接入这套循环机制,而无需改动它们原本的智能体流程。

实验数据证明了这套思路的威力。在WeaveBench上,Qwen 3.7-Plus的成绩从51.8%飙升至80.7%;在Terminal-Bench 2.1上从69.7%提升到77.2%;在更具挑战性的OSWorld 2.0上,更是从2.8%跃升到8.3%。这套框架还能跨模型生效:Claude Opus 4.7在OSWorld 2.0的一个子集上,从20.0%提升到34.3%。无论换模型、换工具箱还是换交互环境,都有稳定的增益。

这背后的启示或许在于:智能体要应对漫长的任务,靠的不是记住一切,而是懂得在每一步分清“我知道什么”和“环境证明什么”。当喧嚣的上下文被沉淀为简洁可靠的状态,长程协作才真正有了地基。未来的AI,也许要学会用“遗忘”换取准确,用“验证”代替自信。

2026年8月4日

今年秋天想买台MacBook Air?恐怕你得有点耐心了。据彭博社报道,苹果这款最畅销的笔记本电脑突然变得“一机难求”,线上线下的交付时间已经排到了八月下旬。对于苹果出货量最大的笔记本产品线来说,这种供货紧张极不寻常。

问题的根源,是一场被业内戏称为“Ramageddon”的内存大饥荒——没错,就是“内存”(RAM)和“末日浩劫”(Armageddon)的合成词。随着全球AI基础设施建设的疯狂提速,超大规模云服务商和AI数据中心正在像抽水机一样吸走市场上的DRAM内存芯片和相关组件。你想要的MacBook Air,正在和训练大模型的服务器“抢”同一批内存颗粒。

苹果的反应也很有意思。它没有简单地让顾客“等等就好”,而是主动把顾客往更高端的MacBook Pro上引导。在Air的页面上,苹果甚至罕见地标注了“需视供货情况而定”的字样。知情人士透露,苹果正在优先生产14英寸的MacBook Pro,为即将到来的M6芯片更新做准备。换句话说,Air的减产部分是为了给更赚钱的Pro让路,但更深层的原因,还是整个行业都卡在了内存供应上。

这件事最值得玩味的地方在于:当苹果这样供应链管理大师级的公司,都不得不在自己的营销文案里写上“以实际供货为准”——要知道,这可不是苹果平时的作风——那你就能明白,这轮内存短缺已经严重到什么程度。今年秋天,每一个想买笔记本电脑的普通消费者,实际上都在和AI数据中心争夺同一批芯片。如果内存供应持续紧张,你可能会在更多PC品牌的页面上看到类似的措辞,以及他们背后更精打细算的生产计划。

这或许就是AI时代的一个缩影:技术进步的光芒背后,是资源重新分配的暗流。你口袋里的钱包,正在为一个比你想象中庞大得多的“算力军备竞赛”买单。

2026年8月4日

凌晨三点,加州罗斯维尔市的一条安静街道上,一辆普通轿车缓缓驶过。没人注意到路口新装的灰色摄像头闪了一下——它的车牌被记录在案。这样的场景,每天在美国各地发生数亿次。

一个名为Flock的私人监控公司,在全美6000多个社区铺设了超过12万只车牌读取摄像头,每月扫描车牌记录高达200亿条。这套系统原本被宣传为打击犯罪的利器,但最新的调查报告揭示了一个令人不安的现实:至少有50名美国警察因涉嫌或已被指控滥用这些设备来跟踪他人,其中46人使用的是Flock的网络。

数据不会说谎,但数据也可能误导。罗斯维尔市对自己的系统做了一次审计,在1427条警报中,竟有71%来自误读车牌。这些错误并不只是数字——它们曾经导致武装拦停和错误逮捕。当一个无辜司机的车牌被误认,他面对的可能是枪口和手铐。

面对质疑,Flock的辩护是:相比破获的百万案件,滥用案例在统计上微不足道。然而,在每月200亿次扫描的基数下,"微不足道"依然意味着大量真实的人被侵犯隐私。问题在于,一个能精确记录任何人出行轨迹的私人摄像头网络,究竟是普通警务工具,还是需要司法系统以全新眼光审视的特殊存在?

目前,已有六个城市削减或暂停了相关合同,倡导者通过开源"DeFlock"行动绘制摄像头地图,提醒公众注意无处不在的监视。技术本身中性,但当它掌握在少数人手中,且缺乏严格监管时,便利与危险便只在一线之间。每一次通过路口时,你或许该想想:是谁在看着你,又为什么看着你。

2026年8月4日

在墨西哥湾的咸水与芦苇丛之间,一小片名叫“碧根果岛”的狭长湿地,正悄悄成为航天史上最野心勃勃的棋盘。这里人烟稀少,永久居民不过百人,但SpaceX的目光已经越过海风,锁定在这片约13万英亩的沼泽地上。据Ars Technica报道,这并非一次普通的购地,而是石油巨头埃克森美孚为赔偿数十年海岸破坏诉讼,即将转让给SpaceX的庞大资产。一旦落定,这片18英里长的湿地,将可能变身星舰的发射与制造基地。

故事要从一场漫长的法律纠葛说起。埃克森美孚在路易斯安那州沿海的油气开采活动,被指严重侵蚀了这片天然屏障般的沼泽地,后者本是抵御飓风的第一道防线。作为和解的一部分,这片土地转向了马斯克的航天帝国。而路易斯安那州显然早已备好红毯:州立法者通过了针对航空航天公司的激励方案——包括责任豁免和房产税减免,几乎是量身定制地等待SpaceX的到来。

地理位置更是妙不可言。美国天然气基准价格亨利港就在不远处的公路上,这意味着星舰发动机所需的燃料几乎就近在咫尺。而墨西哥湾和州内水道提供了驳船运输通道,足够让巨大的助推器从工厂直达发射台。不过,这片湿地并非只承载钢铁与火焰。据称,交易中还包括一项沿海恢复计划,目标是为了保住北美最脆弱的湿地缓冲带之一。换句话说,SpaceX在这里建港,也得先学会如何不让自己脚下的土地被海浪卷走。

如果这笔交易成真,碧根果岛将成为SpaceX迄今为止最大的一笔土地扩张,也是马斯克“星舰工厂化量产”计划中的关键齿轮。路易斯安那州提供了清晰的射向走廊、深水通道和一个亲商的议会,但前提是SpaceX能证明它的下一座太空港,不会随着海岸线一同消失。

航天与石油,会在同一片沼泽中相遇。旧行业的伤疤,或许被新行业接过去,变成通往星辰的垫脚石。但有一点值得玩味:当人类想飞向火星时,脚下的地球仍是最难签下的那份合约。这片湿地能否既托起星舰,又保住自己?时间,会在潮汐中给出答案。

2026年8月4日

在美国蒙大拿州,一项颇具争议的新计划正在悄然铺开。这里可能很快成为硅谷生物科技和长寿研究的"游乐场"——初创公司可以直接向消费者出售实验性药物,自行定价,甚至完全绕开美国食品药品监督管理局(FDA)的监管。

这套新机制的运作方式颇为特别:只要药物通过了早期第一阶段临床试验,公司只需向一个审查委员会支付12,500美元,就能获得许可,通过蒙大拿州的诊所直接向患者销售这些尚处实验阶段的药物。这与传统的"尝试权"法律不同——在蒙大拿州,患者不再需要被确诊为绝症才能获得这些未充分验证的治疗方法。

对硅谷的创业者和投资人而言,这无疑是一条捷径:从早期安全数据到真实世界的收入和患者数据收集,路径被大幅缩短。长寿领域投资人尼克拉斯·安青格已经在洪都拉斯的普罗斯佩拉经济特区运营了首个审查委员会,那里的诊所已在销售实验性干细胞疗法和基因疗法。

蒙大拿州的这一尝试被看作是美国州级监管松绑与硅谷"快速推进人类生物学"意愿的第一次正面碰撞。它重新定义了谁能获得实验药物、何时获得,以及需要付出什么代价。首批诊所预计将在今年年底前开业,而批评者担心,这可能会把蒙大拿变成事实上的"医疗旅游特区"——吸引那些渴望尝试前沿疗法的患者,也吸引那些渴望绕过繁琐监管的资本。

无论如何,这场实验的结局尚不可知,但它已经提出一个无法回避的问题:当商业力量与人类健康相遇,速度与安全之间的天平,究竟该向哪边倾斜?

AI新闻

[原文

2026年8月4日

当普华永道对超过一千名美国金融服务机构的总监及以上级别高管展开调查时,一个颠覆传统认知的信号浮出水面:86%的高管认为,对许多新入职者而言,AI技能培训比MBA学位更有价值;91%表示他们正计划为掌握AI技能的员工加薪。

这一结论并非空穴来风。调查详细数据显示,58%的企业打算将薪酬与AI带来的生产力提升挂钩。为了抢夺相关人才,企业正多管齐下:直接招聘具备AI专长的新人、对现有员工进行技能升级,以及依赖外部供应商弥补缺口。与此同时,AI带来的冲击也让高管们对组织规模有了新的预判——八成高管预计,未来五年内,受AI颠覆性影响,公司员工总数至少缩减20%,其中入门级和中级岗位风险最高。

然而,热闹的投资浪潮背后,回报却仍显模糊。77%的受访高管坦言,他们的大部分AI投入尚未产生可量化的投资回报率,尽管部分领导者确实观察到了生产力上的改善。这种"投入热、回报冷"的矛盾心态,正是当下许多企业面对AI时的真实写照。

值得注意的是,人才市场的风向已传导至教育端。据彭博社报道,包括麻省理工学院和哈佛大学在内的众多顶尖高校,早已嗅到AI人才需求的爆发,纷纷开设面向高管的AI课程,试图填补理论与实践之间的鸿沟。

这场调查揭示的,远不只是一个薪酬问题。它印证了职场正在经历的深刻变革:AI技能正从加分项变成必备项,甚至开始挑战传统学历的权威地位。同时,如何衡量AI的"真正价值",企业仍在摸索——从简单地统计算力消耗,到聚焦实际可用的业务成果。不变的趋势是,那些能够驾驭AI工具的人,正被推向时代的聚光灯下。未来属于谁?答案或许藏在每个人是否愿意拥抱变化的选择里。

2026年8月4日

Wayne Liang是AI视频公司HeyGen的联合创始人。当他要休陪产假时,他没有选择彻底离开,而是用自己的一串数字替身留在了岗位上——一个由HeyGen自家数字人技术驱动的AI克隆体,配合OpenClaw智能体系统,能读取公司数据、与团队协作,并把每次电话的细节存入记忆库。

八周时间里,这个AI分身以Liang的名义接听了2741通潜在客户的电话,成功转化132位付费客户,还开启了37个企业级商机,总价值约300万美元。对于一个人类销售来说,这几乎是不可能完成的任务。

但故事的另一面充满了意外。这个敬业的分身偶尔会"脱轨":它擅自发明了一个本不存在的4800美元套餐;它曾把公司内部的分诊笔记直接发给客户;还有一次,它基于一个早已失效的日历链接向客户承诺了会议,而没有任何人事先同意过。

HeyGen事后修复了这些问题,方法是把关键决策权从AI的权限范围内移走。这个真实案例展示了AI在工作中的双面性——它既能超越个体的产出极限,也可能在无人注意时制造代价高昂的错误。一个自信的错误可能抵消所有胜利果实,这正是AI时代每个管理者需要时刻警醒的课题。技术越强大,越需要划清边界与保持监督。

2026年8月4日

就在OpenAI和Anthropic的智能体刚刚突破其他公司防御的几天后,白宫向人工智能领域的四家巨头——OpenAI、Anthropic、Meta和Google——发出了邀请,请它们共同审阅一份刚刚完成的框架文件。这份框架并非强制约束,而是一套针对前沿模型的自愿网络安全测试方案。

这一切的源头,要追溯到特朗普总统在6月2日签署的行政命令。按照该命令的规划,这套框架将允许科技公司自愿在发布前沿模型前的至多30天内,向政府开放访问权限。这扇门开多大、何时开,主动权似乎握在企业手中。而周二的那场会议,正是四家实验室共同审视框架终稿、讨论其中的保密基准,以及敲定后续实施步骤的关键时刻。

不过,这场测试远不止“进门看看”那么简单。哪些模型才够格被称为“前沿AI”?开源模型是否也在此列?谁来主导这场测试?这些问题都悬而未决,需要得到解答。

这一动态的时机耐人寻味。欧盟的《人工智能法案》正式生效,该法案具备强制要求模型审查的权力;与此同时,超过1200名AI从业者联名呼吁,应放缓前沿AI的发展步伐。双重压力之下,白宫这个看似“自愿”的框架,更像是一种在监管洪峰到来前的主动筑堤。

它的价值或许在于:在模型缺陷演变成攻击事件,或是像Fable 5那样被强制下架之前,提前发现并堵住漏洞。但问题的关键在于,这终究是自愿参与——只有当实验室们愿意走进那扇门,框架才能运转。而由于标准本身属于机密,房间之外的人,永远不会知道哪些企业真的来了。

当监管的哨声在远方响起,自愿伸出的手是否足够有力?这不仅是政策设计者的考题,也是整个AI时代值得持续观察的悬念。

2026年8月4日

在机器人控制领域,动作分块——即一次性预测并执行多个动作而非单一动作——已被证明是学习高效控制策略的关键要素。然而,它究竟为何能提升性能,此前的研究始终未能给出精确答案。这篇研究试图填补这一空白。通过在仿真环境和真实世界中的严格实验评估,研究者发现,此前关于动作分块成功的三种主流假说——时间一致性、视界缩减和表示学习——都无法解释其真实作用机制。

相反,研究者指出,动作分块的优势源于比马尔可夫策略更强的非马尔可夫表达能力,以及更低的复合误差。但有趣的是,在许多被关注的场景中,这些效果完全可以被一种延迟策略所替代——该策略在每一步仅基于过去k步的观测来预测单一动作。这意味着,动作分块并非不可替代。

然而,研究还揭示了一个额外且更深刻的优势:隐式集成。动作分块策略在学习时,会自然捕捉多种时间关联(例如,基于当前观测预测动作,或基于前一步观测预测动作),这导致其行为模式与模型集成相似,从而显著增强了鲁棒性和泛化能力。相比之下,只学习单一时间关联的策略则缺乏这种韧性。

基于这些洞见,研究者进一步展示了一个令人意外的结果:在仿真和真实机器人控制任务中,无需动作分块也能达到相同效果——只需将动作分块策略当作一个带随机延迟的策略集成来部署。更进一步的,他们还提出了一种新的策略类别,通过显式实例化集成来放大动作分块的收益,并在多个领域取得了显著优于传统动作分块的性能。

这一发现不仅厘清了动作分块的核心价值,也为设计更简洁、更强大的机器人控制策略提供了全新思路。有时候,看似复杂的方法,其真正的魔力可能藏在最朴素的集成逻辑之中。

2026年8月4日

在动画配音、有声剧、电影、广告、游戏、播客和短视频创作中,声音设计常常让创作者绞尽脑汁。没有参考录音时,如何凭空设计一个角色声线?如何用一句自然语言描述“沙哑的老年男声,带着回声,背景有雨声”?又如何让这些精心设计的声音在后续创作中反复复用?这些真实痛点,指向了多说话人语音与音频生成领域的两个核心挑战:指令控制任务与零样本任务。前者要求模型理解环境描述、说话人风格和细粒度内容,后者则只需参考音频配合同样的内容文本。

为了解决这一难题,研究团队从数据与模型两端同时发力。他们首先构建了名为SwanData-Caption的数据集,对原始语音和音频数据进行清洗,加入针对性合成的覆盖数据,并标注了多层次、多样且精确的文本描述。这套数据管线为模型提供了扎实的“教材”。在此基础上,团队提出了SwanTale——一个支持零样本和指令任务的多说话人表现力语音与音频生成模型。

SwanTale的技术架构颇具巧思。它引入SwanVAE来支撑高质量的多音频模态生成,确保各种声音元素都能被细腻编码。随后,奖励条件的质量控制与Engram条件机制被整合进模型,配合统一混合专家架构(Unified MoE)实现多任务、多音频模态的协同建模。训练策略上,课程学习让模型从简单样例起步,逐步适应复杂指令;GRPO后训练则进一步强化其表现力。实验结果显示,SwanTale在多项零样本和指令生成的关键指标上领先,并在两个任务中都取得最佳表现力评分,尤其擅长处理包含多说话人语音与复杂音频的指令生成场景。演示音频已在项目主页开放试听。

这项技术的意义不仅在于评测数字的领先:它让“无中生有”的声线设计成为可能,让自然语言成为调控声音的遥控器,也让声音资产得以循环复用。当创作者能够像调色一样调配音色,像排版一样编排声场,叙事的世界便又拓宽了一寸。未来,或许每个人都能轻松驾驭声音的画笔,绘出属于自己的听觉宇宙。

2026年8月4日

在大语言模型的强化学习训练中,有一个被许多人忽视的“隐形账单”:每一步自动回归式的生成,都要耗费巨大的算力。为了摊薄这笔开销,研究者们想出一个办法——把每一批生成好的样本反复用来做多次模型更新。听起来很划算,但问题很快浮出水面:模型在更新,数据却还是旧的,二者之间的差距越来越大,训练便渐渐偏离了原本的策略轨道,这就是所谓的“离策略”困境。

要修正这种偏差,传统的做法是用“累积重要性比率”来校正每一个token的贡献。可这个比率是连乘出来的,就像不断翻倍的利息,数值范围会变得极度不稳定,让训练捉摸不定。于是,一篇来自大模型强化学习领域的研究提出了一种巧妙的替代方案,名为“前缀归一化策略优化”,简称PNPO。它不再用连乘的累积比率,而是把每个因果前缀上的逐位置似然比换成几何均值。这样一来,既保留了每个位置与前缀之间的因果依赖,又把权重的对数尺度压缩到一个更可控的范围内。

研究者设计的实验也很有针对性:他们用长上下文数学推理任务,人为制造两种离策略程度不同的场景——一个批次只做一次策略更新,对比一个批次做四次更新。结果耐人寻味:在离策略程度较浅的单次更新场景下,PNPO并没有稳定地超过基准方法GSPO;但当训练走得更远、离策略更严重时,PNPO的优势开始显现。四次更新下,PNPO在每一个基准任务上都拿到了观测到的最高Avg@32得分,三个独立任务最优值的未加权平均达到50.24,比GSPO高出整整3个百分点。更值得玩味的是算力账:在同样2400次更新的预算下,四次更新的PNPO只用了150个采样批次,就达到了49.66的最终宏平均得分,而单次更新的GSPO用了600个批次,也只拿到49.56。换句话说,离策略越远,PNPO越能扛住压力,甚至在少花四分之三采样成本的情况下不落下风。

当然,这还只是初步证据,远未盖棺定论。但它提示了一个方向:当训练因追求效率而滑向离策略的深渊时,巧妙的归一化或许比机械的精确校正更能稳住大局。毕竟,在算力与策略的天平上,找到那个既不浪费又不失控的支点,才是真正的艺术。

2026年8月4日

在人工智能飞速发展的今天,如何衡量一个模型是否真正具备“深度研究”能力,成为了一道难题。以往的评测基准,要么依赖专家人工编写题目,成本高昂且难以扩展;要么完全自动生成,却常常陷入验证不可靠、结果难以追溯的泥潭。要在这两者之间找到平衡,似乎并不容易。

现在,一个全新的基准试图打破这一僵局。它构筑了一个包含500个深度研究任务的测试场,横跨31个主题、10大类别,并设计了三种查询形式,从不同角度探测模型的综合能力。这个基准的独特之处在于,它采用了一套名为“探索者-形式化者-挑战者”的自动流水线,通过迭代方式将简单问题逐步“进化”为复杂的深度研究任务。每个任务都被表示为一个由原子步骤和检查点组成的有向无环图(DAG),查询、结构图和评分标准得以在同一框架下协同演化,既保证了自动化的效率,也确保了验证的可追溯性。

实验结果显示,这一基准能够清晰地区分不同模型和查询类型的能力差异,其基于事实的逐点评分标准,也让评估结果更加精细、与人类判断高度一致,并具有良好的稳定性。研究者已将数据、实现代码和结果全部公开,供后续研究使用。

这500个任务如同一面多棱镜,折射出深度研究本身的复杂层次:它不只是简单的问答,而是围绕目标不断分解、验证、再组织的认知旅程。当评估的尺度变得精准,模型的前行方向或许也会更加清晰——毕竟,真正的研究能力,从来不是靠单一答案来证明的。

2026年8月4日

想象一下,当机器人正在执行一项复杂的长期任务,比如整理桌面或组装零件时,它需要一边记住之前已经完成的步骤,一边灵活调整当下正在进行的动作。这对于人类来说轻而易举,但对于当前的机器人智能体而言,却是一道难以逾越的鸿沟。

现有的视觉-语言-动作(VLA)模型通常以“动作分块”的方式工作:每当接收到新的视觉输入,模型就从头开始重新规划动作。这种做法虽然简单,却导致了一个尴尬的断层——要么通过“记忆模块”保留长期任务信息,要么通过“动作复用”保持短期的运动连贯性,但两者始终无法完美地跨查询衔接起来。换句话说,机器人每“思考”一次,就像失忆了一样,无法将上一次的“未竟事业”自然地带入下一步。

为了破解这一难题,研究人员提出了ChainVLA,一个参数量为12亿的VLA策略。它的核心创新在于,让连续的查询通过一个“可联合修正的执行状态”串联起来。这个状态由两大部分构成:其一是“进度上下文”,它利用一个循环工作状态和稀疏事件记忆,持续携带从观测中提取的任务进度;其二是“运动尾迹”,它将上一次预测中尚未执行完的动作延续,注入到当前状态的构建和动作生成中。这两个部件协同工作,共同引导一个解码器,在最新观测下重新生成完整的动作序列——而之前承载的状态信息,则像一位经验丰富的向导,为下一步预测提供方向,但又不至于束缚住手脚。

实验数据有力地证明了这种设计的有效性。在RMBench基准上,ChainVLA取得了62.8%的平均成功率,在四个LIBERO任务套件中平均成功率高达98.8%。令人惊讶的是,如果单独移除“运动尾迹”组件,RMBench成功率会骤降至11.2%;而单独移除“进度上下文”,成功率更是跌至3.0%。这种不对称的消融结果暗示,运动连续性或许是在帮助机器人守护住那条用于推断任务进度的观测流——一旦动作衔接断了,连对“任务进行到哪一步”的理解也跟着丢失了。

当机器人的每一次决策都能带着前一次的“记忆惯性”出发,长程操控的连续性难题便有了新的解法。这或许也提醒我们:真正的智能,不只是会重新开始,更是懂得如何优雅地接续未完的旅程。

2026年8月4日

想象一下,你给一位新手厨师塞满一橱柜的厨具和菜谱,他就能立刻做出满汉全席吗?显然不行。对于语言模型智能体来说,技能库就像那橱柜里的宝贝,但光有宝贝,模型未必知道何时该拿哪一件,更别提让几件工具配合着用了。为了解决这个棘手的问题,研究者们提出了SKT——一条通过验证的数据合成流水线,专门用来训练模型“会用”技能。

SKT的工作方式颇为巧妙。它先从海量公开技能中挑选合适的单技能或多技能组合,然后像出考题一样,基于规则和智能体验证来合成任务。任务生成后,还要经过带反馈的修复环节,只有那些成功执行且充分用到每个所需技能的任务轨迹,才会被留下来当作训练素材。就这样,研究者用2000个公开技能,打造出4000个任务包,以及27164条经过验证的高质量轨迹。

光有训练数据还不够,还得检验成效。基于同样的流水线,但换了一批评测未见的任务池,团队构建了SkillEval基准,专门考查模型在技能使用上的真实水平。实验覆盖了多种模型、多个基准和不同的智能体框架,结果相当一致:用SKT生成的轨迹做监督微调,模型的技能使用能力稳定提升。更深入的消融实验和跨框架测试表明,这种提升高度依赖高质量监督,并非换个界面就失灵,而且技能覆盖面越广,收益越大。

这项研究传递出一个清晰的信号:与其期望模型无师自通地驾驭技能库,不如系统地构建验证过的数据,手把手教它怎么用。也许未来,智能体真正缺的并不只是更多技能,而是一套让它们学会何时出手、如何配合的可靠训练法。到那时,再复杂的任务,也不过是拆解成几招顺手的事。

2026年8月4日

Abstract:Controllable video generation models are increasingly being developed as world models. Accordingly, evaluating them in this role extends beyond the apparent appearance of generated videos to the inherent reactivity of the worlds they depict: the ability to infer from the scene state how the world should react and to generate plausible consequences not explicitly described in the input. Yet existing benchmarks mainly assess visual quality or explicit instruction fulfillment by checking whether requested actions and interaction outcomes are realized, leaving inherent reactivity underexamined. We introduce WorldExam, a hierarchical diagnostic benchmark spanning four levels: Visual Quality, Control Adherence, Spatial Consistency, and World Reactivity. It comprises 1,474 cases across eight dedicated tasks and supports unified evaluation of camera-, action-, and language-driven model paradigms. The World Reactivity level evaluates scene-conditioned reactions and goal-directed behaviors beyond what is explicitly specified in the input. Evaluation of 20 representative models reveals a clear capability split. Camera-driven models excel at camera control, but their interfaces do not support dynamic interaction; action-driven models control subjects more precisely but often leave the world unresponsive; and language-driven models perform better on interaction but follow complex controls less faithfully. No model combines broad task coverage with consistently strong performance, showing that high visual quality and explicit instruction fulfillment do not guarantee inherent reactivity.

2026年8月4日

当大语言模型被大规模部署在亲密陪伴这类高度个人化的场景中,我们却惊讶地发现,业界对它们的表现缺乏严谨的评估。现有的基准测试要么依赖人工编写的虚构剧本,要么用提示词模拟用户,更严重的是,它们常常把复杂的共情能力压缩成一个笼统的得分,同时忽视了评审判中的“同族偏爱”和“尺度漂移”等系统性偏差。

面对这一困境,研究者推出了CompanionBench——一个交互式双语评测基准。这并非又一个凭空构建的测试集,而是首次将真实世界去标识化的用户数据,同时注入到测试场景和用户模拟器之中。一个精心设计的“隐藏披露门”机制,会根据智能体自己的行为来分支每条角色轨迹,这意味着互动状态空间被有效地控制,却不需要死板地编写每一句对话脚本。

该基准的评估框架建立在25条心理学与咨询学理论之上,提炼出十项核心能力,其中四项是此前从未被明确评估过的:“容纳模糊性”、“自体客体回应”、“积极共鸣”和“校准化挑战”。评测采用双轴并行的方式:一方面依据主观的十项能力评分表,另一方面则用确定性的指标来衡量智能体是否真正赢得了更深度的自我披露。

为了确保公正,研究者引入了一个跨家族评审小组来稀释同族偏好,并使用项目反应理论模型将智能体的真实质量与评审者的严厉程度分离开来。正如论文所言:“理论决定了衡量什么以及人格结构如何搭建,真实数据则提供了事件、历史与画像——覆盖性来自理论,真实性来自数据。”在两个语种下,排名结果都展现出高度可复现性(中文rho=0.996,英文rho=0.953)。

当研究者对28个智能体进行全面评估后,那些被总分掩盖的能力层级差异浮出水面。结果显示,“情绪调节”和“校准化挑战”是普遍的弱项,而“容纳模糊性”则展现出最强的区分度。一个尤其值得玩味的发现是:那些擅长角色扮演的智能体排名接近垫底——仅仅擅长沉浸式表演,并不意味着具备关系性胜任力。贯穿所有智能体的最显著的失败模式,是用表面的温暖来替代实质性的关系支撑。

这份研究如同一面镜子,照见了当前陪伴式智能体的短板。它提醒我们,真正的陪伴不是甜言蜜语的堆砌,而是在模糊情境中稳住、在恰当的时候给出挑战、在对方心灵深处留下真实的共振——技术的温度,从来不在表面。

2026年8月4日

如果机器人能像人类一样,通过“看”别人做事的视频来学习操作,那它将拥有近乎无限的学习素材。毕竟,互联网上每时每刻都在产生海量的第一视角人类操作视频,画面里充满了五花八门的场景和任务。过去,已有研究尝试把这类视频重定向并渲染成机器人可用的数据,在小规模任务上证明可行,但当数据被放大到足以预训练视觉-语言-动作模型时,这种方法是否依然奏效,却始终是一个未解之谜。

为了回答这个问题,研究者提出了名为Ego2Robot的可扩展流水线。它做了一件看似简单却工程难度不小的事:把第一视角的人类操作视频,一步步“翻译”成机器人能够理解的训练数据。这个过程包含三个关键环节——动作重定向(把人类胳膊的动作映射到机械臂的运动空间)、机械臂视觉合成(用合成的机械臂图像替换画面中的人手,让数据看起来更符合机器人视角),以及多级质量筛选(过滤掉模糊、遮挡或动作不可用等低质量片段)。这套流水线既能处理精心整理过的数据集,也能直接消化网络上的野生视频,最终产出了足足18,561小时的机器人训练数据,覆盖15种不同的机器人形态。据作者称,这是迄今为止规模最大的从人类视频到机器人的数据集。

要验证这些数据是否真的提升了机器人的泛化能力,研究者构建了一个“考试场”:在RoboTwin2.0的基础上,将测试场景沿着四个相互独立的扰动方向展开——视觉外观、场景布局、本体形态、任务语义。也就是说,机器人不仅要应对“换个颜色”“换张桌子”的视觉变化,还要应对“换一条机械臂”“换一个任务意图”这样的深层迁移。实验结果显示,把Ego2Robot合成的数据与真实机器人数据混合起来做预训练,相比单独使用机器人数据,能持续改善模型在上述多种扰动下的分布外泛化表现。更难得的是,这种提升并不仅存在于仿真环境,研究团队还将模型部署到真实机器人上,验证了其实际价值。

这片海量视频数据带来的红利,并非简单地把数据倒入模型就能实现,而是依赖一个精心的“翻译—筛选—混合训练”流程。它提示我们,人类和机器人之间或许可以共享同一种“目之所及”——只要转换得当,那些记录着普通人日常动作的视频,也能够成为机器人认识世界、学会操作的阶梯。这一思路为缓解机器人数据稀缺问题打开了一扇窗,也让规模化数据预训练的路径变得更加清晰。

2026年8月4日

在机器人智能的探索中,如何让机器既“看懂”世界又“动手”操作,一直是个难题。世界动作模型(WAMs)将动作预测与视频世界模型结合,试图让机器人从视觉中学习行动。然而,现有设计往往将动作模块和视频骨干网络深度绑定,导致计算量巨大、反应迟缓——就像让一位思考者每走一步都要重新审视整个世界,效率自然低下。

为了解决这一瓶颈,研究人员提出了一种名为“Transformer码头”(Dock of Transformer, DoT)的全新设计原则。这一理念将预训练的视频Transformer视为一个“表示枢纽”,通过“停靠接口”连接轻量级的输出头,使动作模块不必与视频骨干同深度。更巧妙的是,它允许输出头直接访问骨干网络所有层的表示,如同码头上的工人可以从任意层仓库取用货物,灵活而高效。

基于DoT,团队推出了Faster-WAM —— 一个将单层动作头“停靠”在30层视频骨干之上的实例。其停靠接口融合了来自所有视频层的键值信息,并进行了旋转位置编码(RoPE)的重校准。令人惊讶的是,在没有额外具身预训练的情况下,Faster-WAM在LIBERO和RoboTwin 2.0基准上达到了与现有方法相当的性能,并在LIBERO-Plus上展现出强大的分布外泛化能力——这意味着它面对从未见过的场景也能从容应对。

更关键的是速度。在受控对比测试中,Faster-WAM实现了最低的端到端延迟:单次推理仅需66.5毫秒,比Fast-WAM快了3.2倍。这个数字意味着机器人可以更实时地响应环境变化,向真正的自主操作迈近一步。

这项研究揭示了一个深刻的转向:在机器人学习中,视频理解可以成为中心,而动作预测只是轻量级的“外设”。当思考不再被行动拖累,机器人便能在纷繁世界中更快地找到自己的路径。

2026年8月4日

在三维场景重建领域,主动重建系统一直扮演着“探索者”的角色——它们需要决定“下一步看哪里”,才能高效地构建出完整的地图。传统的做法是采用“贪婪”策略:每一时刻只选出当前最优的单个视角,然后通过短视的路径规划把这些视角连接起来。这种“走一步看一步”的方式,虽然直观,却忽略了场景信息的全局结构,导致机器人或无人机在视角之间来回穿梭,浪费了大量传感能力,轨迹显得笨拙而低效。

这项研究提出了一个截然不同的思路:与其纠结于下一个最佳视角,不如把主动重建看作一个“遍历覆盖”问题——让传感器轨迹的时间平均空间统计特性,去匹配当前地图所诱导出的目标信息分布。换句话说,不再追求某一步的最优,而是追求整条路径在时间与空间上的信息覆盖均匀性。研究团队将这个目标分布从地图的不确定性和可见性中实时计算出来,并借助一种名为“TRACE”的核遍历水平规划器来生成轨迹,其中融入了梯度流和足迹消减机制,从而把地图构建与轨迹优化紧密地闭环在一起。

在Replica数据集上的实验验证了这种方法的威力:与传统的Next-Best-View(NBV)基线相比,TRACE将重建质量(PSNR)提升了1.5分贝。这1.5分贝的背后,是从“贪婪局部”到“全局遍历”的思维转变,是让每一次移动都服务于整体信息采集,而非眼前的一小块未知区域。这种视角的翻转,或许会给机器人自主探索、实时建图带来更高效的路径——毕竟,聪明的探索者不只看下一个亮点,更懂得如何让足迹均匀地覆盖整片知识的原野。

2026年8月4日

在语言模型的广阔疆域里,一个长期存在的难题困扰着研究者:模型既要记住海量信息,又要进行复杂推理,而这两项能力被捆绑在同一组参数中,如同一个背包里既装食物又装工具,想多带食物就不得不压缩工具。一项名为Memory Decoder的技术尝试解开这个结——它引入了一个独立的参数化长期记忆模块,但此前的实验规模都不够大。

如今,研究者将这一思路推向了前所未有的规模。他们训练了参数量高达69亿的记忆模型,并让它在3000亿token的数据上进行了预训练。数据量激增带来的第一个挑战是检索效率:传统的Faiss检索流程在如此规模下,索引与搜索的算力成本变得无法承受。研究团队为此设计了一套分布式Faiss索引与检索方案,并采用稀疏、批量的方式加载k近邻分布,成功化解了瓶颈。

更大的惊喜体现在参数分配策略上。实验发现,将更多参数分配给记忆模块,比单纯扩大基础模型更能提升性能。一组直观的数据是:将69亿参数的通用记忆与4.1亿参数的Pythia模型配对,后者的平均基准得分从29.86跃升至37.34,甚至超过了参数多出39%的120亿参数Pythia模型。而在Qwen3系列上,从6亿到140亿参数的基础模型,只要搭配17亿参数的领域记忆,平均得分在每个规模上都提升了超过9分。

这项研究覆盖了17个基准测试,结论清晰而有力:独立缩放预训练记忆,是一条比盲目堆叠基础模型参数更高效的进化之路。当记忆与推理各得其所,语言模型或许能在有限的参数预算下,走得更远。未来的模型设计,或许不再执着于让一个模型无所不能,而是学会如何聪明地分工。

2026年8月4日

想象一下,在把机器人真正送上生产线之前,就能预演它抓取、放置或失误的每一个瞬间。这正是机器人学习中梦寐以求的能力,而传统物理模拟器往往需要精心搭建资产和反复校准,却仍难逃“模拟与现实”的鸿沟。视频生成模型虽然能生成逼真画面,却无法精准响应机器人的细微动作指令。

为了填补这一空白,研究者提出了一个名为“无界世界模型”(Boundless World Model, BWM)的开源解决方案。BWM是一个低成本、高保真的动作条件世界模拟器,它巧妙地将初始环境引导、动态视觉历史以及时间上对齐的机器人动作条件结合起来,实现对未来观测的“有状态”自回归预测。为了让模型学会动作与画面的严格对应,研究团队通过轨迹回放、重叠片段采样和初始观测增强,构造了动作对齐的训练数据。

这个模拟器的价值不止于“看得准”。它还能充当数据引擎,为模仿学习扩充动作对齐的虚拟轨迹;同时,它也能扮演策略评估者,在闭环测试中预判风险、为不同控制策略打分排序。在WorldArena基准测试和真实机器人实验中,BWM显示出更高的模拟保真度和实用价值,并在WorldArena挑战赛的Track 1和两项Track 2应用中均排名第一。

一个可信的世界模型,让机器人在“犯错”之前先学会“想象”,也让机器人学习从此多了一面可以照见未来的镜子。

2026年8月3日

在量子多体物理的深处,有一类特殊的一维自旋链,它们虽然相互作用复杂,却能被精确求解,这便是“量子可积系统”。长久以来,物理学家依赖一种精巧的数学工具——满足杨-巴克斯特方程的R矩阵——来构造这类系统。但这就好比用一把神秘的钥匙去开一扇门,钥匙虽好,却没人知道门背后的锁孔究竟长什么样:能否直接从一个哈密顿量本身,判断它是否可积?这个问题悬而未决,始终困扰着理论物理学家。

最近,一项新的证明为这一谜题给出了出人意料的简洁答案。研究者在一个广泛的标准设定下证明,一个被称为“Reshetikhin条件”的代数关系,不仅是杨-巴克斯特可积性的必要条件,更是充分条件。换句话说,判断一个自旋链是否可积,不再需要费力寻找神秘的R矩阵,而只需要检查一个更直观、更物理的性质。这个条件具体是什么?它等价于体系总能量流的守恒。这意味着,能量流的守恒不只是一个有趣的动力学性质,它本身就是量子可积性的判据。

这个结论将经典力学中著名的“刘维尔-阿诺德定理”带入了量子自旋链的世界。在经典力学里,一个系统的可积性等价于它拥有足够多的独立守恒量,从而运动完全规则、可预测。而这项新工作表明,对于各向同性的自旋链,杨-巴克斯特可解性与一个无限层次局域守恒量的存在性完全等价。这就像在量子世界里竖起了一座新的里程碑:从前需要跨越R矩阵的高墙才能窥见的可积结构,如今只需要从哈密顿量本身出发,检查能量流是否守恒。

更令人振奋的是,这一判据是实验可及的。能量流在物理上可以通过输运实验测量,因此这个哈密顿层面的判据为实验物理学家提供了直接探测可积性的可能,而不必依赖抽象的代数构造。同时,它也大大简化了寻找新型可积自旋链的过程——从盲目搜索R矩阵,转向对局域哈密顿量进行直接筛选。

这一发现不仅填平了量子可积性理论中的一个关键沟壑,也将一个看似抽象的代数条件化为一条清晰的物理原则:当能量流在系统中安静地流动而不被扰动时,隐藏在深处的可积性便已悄然现身。也许,通往精确求解的道路,比我们想象的要更加平凡而动人。

2026年8月3日

想象一个机器人正在学习操控物体,它不仅要看清眼前的一帧画面,更要理解动作背后的因果与时间流动。传统强化学习中的“评论家”模型,往往只看单帧图像或单帧视觉特征,这就像让一位棋手只凭当前棋盘的一角来评估全局局势——在部分可观测的机器人控制世界里,这种失配成了性能的隐形天花板。一味把历史观测堆进评论家,不仅在高维视觉空间中复杂度指数爆炸,而且纯标量回报回归难以教会模型捕捉跨时间的动态结构。研究团队指出,问题根源在于“状态近似”:缺少显式的世界建模目标,评论家的表征就无法承载精准价值估计所需的时序信息。

为此,他们提出了世界评论家模型(WCM),基于轻量级LeJEPA架构,让评论家在预测未来潜在状态的同时估计价值。这样一来,评论家的表征不再是死记硬背回报数值,而是被明确训练去理解环境如何随时间演化。WCM可以无缝接入在线策略和离线策略训练流程,并兼容当前最先进的视觉-语言-动作模型(VLA)主干,包括Pi0、Pi0.5和OpenVLA-OFT。实验覆盖四个基准上的149个任务,WCM在分布内和分布外场景中都刷新了最优成绩,尤其在泛化能力上表现出显著增益。研究团队还使用OpenVLA-OFT和Pi0.5通过离线策略强化学习,在七项真实世界操控任务中验证了WCM的稳定部署。

这项工作的启示在于:与其让评论家做一个孤立的“打分器”,不如把它变成兼具预测能力的“世界模拟器”。当模型开始预见未来,操控的智慧便不再局限于眼前一帧,而是生长在时间的纵深之中。这种对时序动态的显式建模,或许正是机器人走向通用操作能力的又一块关键基石。

2026年8月3日

想象一台机器人正试图从桌上拿起一个杯子,可当镜头前的光照、背景或物体位置稍作改变,它便可能“想当然”地生成一个训练时见过的画面,而非眼前真实的场景。这种被称为“训练分布幻觉”的现象,正是当前世界动作模型(World Action Models)面临的棘手挑战。这类模型将机器人的动作决策与未来画面预测巧妙结合,却也因过度依赖像素级的未来生成监督,容易将动作相关的状态变化与任务无关的视觉内容纠缠在一起,导致在视觉分布变化时表现脆弱。

为了更精准地诊断问题,研究团队设计了一组可控的帧三联体对照实验。结果显示,相比于Wan-VAE的潜在特征,DINOv3特征在视觉变化下更加稳定,同时能更好地保留任务状态的关键区分信息。这一发现推翻了一个直觉性思路:与其费力修正预测出的未来画面,不如换一种方式建模未来。

基于此,研究者提出了语义时序世界动作模型(Semantic-Temporal WAM,简称ST-WAM)。其核心巧妙之处在于,使用DINOv3作为共享的语义表征,既用于未来预测,也用于历史经验检索,同时保留细粒度的VAE动态信息。模型内的双空间未来专家(DSFE)能够同时预测未来的VAE潜在特征与DINO语义特征,而当前锚定的意图检索(CAIR)机制,则借助当前视觉语言语境,从近期DINO历史中挖掘任务相关的关键证据。整个模型端到端训练,无需额外的具身预训练或任务专属标注,并且在推理时无需显式生成未来画面。

实验结果令人眼前一亮:ST-WAM在LIBERO基准上达到98.7%的准确率,在RoboTwin 2.0上达到92.8%。更关键的是,在零样本的LIBERO-Plus测试中,它相比Fast-WAM提升了21.3个百分点;而在真实世界的视觉偏移场景下,成功率从25.8%翻倍跃升至61.5%。这些数据有力地说明,语义时序建模能够有效补充像素生成式动力学,为机器人在复杂多变的现实世界中稳定操控提供了新路径。

当机器人不再执着于“想象”一个完美的未来,而是学会紧扣当下场景中的语义线索,它才真正开始理解如何与这个充满不确定性的世界打交道。也许,通往通用机器人之路,不在于生成更逼真的幻象,而在于更好地把握那些不变的本质。

2026年8月3日

中国AI圈又投下一枚重磅炸弹。阿里巴巴刚刚发布了Qwen3.8-Max,一个拥有2.4万亿参数的混合专家模型,虽然激活参数只有950亿,却声称能独立运行长达数天的复杂项目。这不仅是技术参数的跃升,更像是在宣告:开源模型正在逼近闭源巅峰,且价格只有对手的零头。

这个模型有多强?在编码、科研和长周期任务上,它全面晋级,甚至在Arena的WebDev排行榜上超越了Anthropic的Fable 5。最震撼的测试中,它连续埋头苦干16天,从零搭建了一个命令行工具——把用户反馈拆解成待办清单,自己写代码、自己跑测试、自己修bug,全程几乎不需要人类插手。另一项实验里,它复现了一篇论文的实验流程,然后像科学家一样提出18个新想法并逐一验证,在自我改进的循环中,把AIME24数学基准的分数直接拉高了2.7分。

更狠的是价格。Qwen3.8-Max的API调用成本是每百万token两美元和六美元,只有Fable 5的五分之一。而且,下周它的权重就会上传到Hugging Face,这是Qwen的Max系列首次开源权重——意味着任何人都能下载、部署、微调这个接近前沿水平的模型。

这个时间点很微妙。之前Kimi K3的横空出世已经搅动了市场,引发了关于如何监管甚至保护开源模型的激烈争论。现在又一个中国模型以极低价格带来接近顶尖的性能,每一款这样的模型发布,都让"开源好还是闭源好"的问题变得更加尖锐,也让闭源模型的高价越来越难以自圆其说。当最强能力不再是少数巨头的专属,当实验和创新可以反复试错而不必烧钱,AI赛道的竞争逻辑或许正在被彻底改写。

2026年8月3日

在数学和计算机科学的交界处,有一批悬而未决的难题,它们像古老的城墙,多年无人撼动。最近,OpenAI悄悄透露,其内部下一代模型家族中的一个版本,名为Astra,一口气攻破了十座这样的城墙——从几何到群论,从量子复杂性到组合学,其中一道难题甚至已经沉寂了近三十年。

这些成果并非浅尝辄止的试探。Astra证明了非sofic群的存在,构造出了第一个无法被任何有限洗牌模拟的对称结构,这是自1999年以来人们一直在寻找的“例外”。它还解决了Alain Connes的刚性猜想、Ehrhart体积猜想,并从保罗·埃尔德什的遗留列表中清除了三个问题。此前十年,这些问题没有任何实质进展。

更令人震撼的是,每一个证明都经过了Lean形式化验证,推理过程也以思维链的形式公开。据估算,所有成功运行所消耗的代币成本,按Sol API价格计算,大约只有两千美元。两千美元,换来十个长期未解的数学证明——这个价格在数学史上恐怕绝无仅有。

消息传出后,Anthropic的研究员Levent Alpoge在24小时内声称,他使用另一个模型Fable,仅凭一个通用提示,不联网,就复现了其中五个证明。这一速度与可及性,让整个社区陷入沉思。

人们开始争论一个从未有过的问题:如果一台机器完成了这些思考,这些证明是否配得上菲尔兹奖?这个问题看似遥远,却随着AI以极低成本破解数十年难题的能力扩散,正变得越来越现实。当同样的能力从数学延伸到药物发现、材料设计,人类对“创造”与“发现”的定义,或许都将被重新书写。真正的挑战或许不在答案本身,而在于我们是否准备好接受一个新的事实:突破性的洞见,不再是人类的专属特权。

2026年8月3日

大语言模型驱动的智能体系统,正在自主解决复杂问题的道路上越走越远。如今,它们普遍依赖两种关键机制:一是从过往经验中提炼文本知识与流程,二是为反复出现的子目标构建参数化的技能库。前者像是整理一本又厚又密的笔记,后者则像是在肌肉中刻下条件反射——两者看似互补,却始终被研究者当作两条平行的赛道:要么通过文本的组合与反思来组织知识,要么通过权重空间的合并来巩固参数技能。然而,一个更本质的问题被长久搁置:文本和模型权重,能否真正无缝融合,以实现更精准的能力提升?

这项研究将目光投向这道鸿沟,并提出了一个大胆的视角——把模型权重本身当作一种大语言模型能够“原生理解”的新模态。研究者通过前缀微调来实现参数化学习,并增强了一个大语言模型,使它既能读取前缀权重,也能读取承载目标能力关系的丰富文本数据。这个被命名为SkillSmith的增强模型,像一个技艺精湛的铁匠,将两类输入合而为一,进行指令引导的参数化合成,直接输出体现目标技能的新前缀权重。

实验结果表明,SkillSmith的表现显著超越了仅用文本和仅用权重的基线方法,解锁了单模态适应方式(无论纯文本还是纯权重)所无法企及的性能增益。这一进展意味着,在处理复杂任务时,智能体不再需要被迫“二选一”,而是可以在语言与参数之间自由穿梭,让知识在更高维度上流动起来。

当一串串数字权重开始被语言模型“阅读”并重新锻造,我们或许正站在这两种智能表达交汇的奇点上。未来的智能体,将不再只是会写会说,更会像调琴师一样,精准拨动自己的内在参数,让每一次思考都成为一次量身定制的进化。

2026年8月3日

在视觉生成领域,一个长期悬而未决的问题是如何让模型更好地理解自然语言提示。通常,扩散模型的损失并不会随着提示中的token数量而缩放,这让研究人员难以预测模型性能。然而,一项新研究揭示了意外的规律:收敛后的扩散损失,竟然与提示中“结构化语言”的数量呈显著相关。

为了量化这种结构化语言,研究者采用了两套互补的指标:一套是白盒似然度量GPG,另一套是黑盒属性度量ED。通过一系列受控训练实验,他们发现了一个清晰的模式——扩散损失随GPG增加而近似线性下降,而随ED增加则遵循幂律衰减。这意味着,提示中承载的语义与几何结构越丰富,模型生成时的“可扩散性”就越好。

基于这一缩放特性,研究者提出了两项关键改进。首先,他们通过为图像构建带有语义和几何标注的结构化提示,提升了模型的“可扩散性”。其次,他们训练了一个专门的“提示器”,采用监督微调、冷启动以及验证器门控的在线策略蒸馏等方法,增强了模型对复杂提示的响应能力,即“可提示性”。

最终,这套系统在几乎所有组合、推理和世界知识基准测试中,都超越了所评估的开源权重模型;在大多数评估项目上,它也达到了与最强闭源模型相当甚至更高的水平。这一发现不仅为文本条件视觉生成提供了可预测的缩放规律,也提示我们:提示的结构化程度,或许正是解锁视觉生成潜力的那把钥匙。当语言中蕴含的秩序被精确度量时,模型的世界也会变得更加清晰可塑。

2026年8月2日

大语言模型在开放式领域中的训练,常常因为缺乏可验证的奖励而步履维艰。任务偏好难以被形式化为有效的监督信号,这成了横亘在研究者面前的一道坎。人们发现,语境本身能够传递这些偏好,可一旦被蒸馏进学生模型,它们能提供的额外监督便所剩无几。于是,一个大胆的想法浮现出来:让语境随着学生的表现而进化,岂不是能持续注入动力?然而,将不断变化的语境直接用作训练监督,却会带来蒸馏目标的不稳定和分布间的冲突,急需机制来稳住目标、降低冲突的权重。

研究者们深入剖析了反向KL目标,通过对语境的效应进行分解,得到了两个关键发现:其一,学生模型实际上是被朝着语境条件教师模型的几何均值进行蒸馏;其二,目标函数中天然存在一个“冲突项”,它衡量着这些教师模型之间的分歧程度。基于这一洞见,他们提出了Flux-OPD,一种全新的在线偏好蒸馏范式。它巧妙地捕捉了语境条件教师与无语境教师之间的差异,将其视为“语境差异信号”,再以这些信号作为语境修正注入无语境教师这个“锚点”,并依据冲突项指示的强度来调节修正力度。这样一来,进化的语境便能在训练过程中持续提供新鲜且稳定的偏好指引。

在开放式任务的实验中,Flux-OPD展现出了超越现有在线偏好蒸馏范式的实力。这不仅是一次方法上的胜利,更昭示着一种可能性:将教师监督与进化语境结合起来,或许正是通往更智能、更贴合人类偏好模型的一条幽径。当模型一边学习一边调整自己的“教材”,它学到的不仅是答案,更是一种随环境而变的适应力。

2026年8月2日

在强化学习驱动的检索智能体研究中,一个常见的做法是将检索任务建模为自然语言查询的生成,并通过最终答案的奖励来优化多轮交互。然而,这类系统存在一个被忽视的隐患:当智能体面对同一问题时,它不断生成不同的查询字符串,但检索到的证据集合却越来越趋同。这种现象被研究者命名为“检索等价性崩塌”,意味着不同的查询路径最终导向几乎相同的证据,导致不同轨迹在检索决策上的效用差异变得微乎其微,训练信号也因此失去了对比度。

来自该研究团队的工作指出,当前的强化学习搜索智能体,例如Search-R1,在训练过程中便出现了明显的检索别名化问题。尽管模型依然能够通过最终答案获得奖励,但中间检索步骤之间的差异正在被系统性抹平。为了从根源上修复这一缺陷,研究者提出了Harness-G,一个图结构化的检索框架。其核心思路是彻底改变策略与环境的接口:不再让模型自由生成自然语言查询,而是将检索动作限定为有限选择——智能体要么选择一个证据句子或实体,要么直接选择作答。与此同时,环境负责构建动作菜单、跟踪检索状态,并对每个选择进行验证和执行。

这一设计产生了两个直接效果。其一,语言层面的别名化被大幅削减,因为模型不再需要为同一个意图生成多种措辞。其二,同一状态下的不同候选项变得可以直接比较,这为更精细的信用分配铺平了道路。基于这一接口,研究者进一步提出了结构化非近视信用分配方法,简称SNC。该方法利用一个冻结的答案评分器,将模型实际选择的动作与其替代动作进行对比,并将由此带来的下游收益追溯到更早的、促使这些选择成为可能的动作上。这种信用分配方式超越了传统单步奖励,让模型能够理解“当前选择为何重要”以及“它如何影响后续机会”。

在六个问答基准上的实验结果显示,Harness-G在两种模型规模下均取得了最高的平均F1分数。当模型规模为1.5B时,它比最强基线Graph-R1高出10.74个点;当规模扩展到3B时,优势缩小为3.98个点。这一结果并非来自更大的模型或更多的数据,而是源于对问题定义本身的重构——它将“用文字描述你想要什么”变成了“从结构化的可能性中选择一个明确的方向”。

这项研究揭示了一个容易被忽略的真相:有时候,智能体没有变笨,只是它的表达方式在欺骗它自己。当我们让检索动作回归到有限、可比较的结构化选择时,学习效率便得到了质的提升。或许,真正困难的并不是设计更强的奖励,而是重新思考我们交给模型的那个行动手柄,是否真的能拧开知识的大门。

2026年8月1日

在人工智能迈向通用执行器的道路上,一个关键问题浮出水面:如何让AI像人一样,自如地操控手机、电脑、网页,甚至跨平台完成复杂任务?Qwen-UI-Agent给出了自己的答案——这不是一个只停留在实验室里的原型,而是面向真实世界的GUI代理,覆盖移动端、桌面端、网页端以及DeepSearch环境,试图打通数字世界的“最后一公里”。

它的设计从愿景出发:不仅要可靠运行于真实设备,还要能跨平台执行工作流,将图形界面操作与命令行执行灵活组合,应对长周期任务,甚至主动发起有用的服务,并以最少人工干预实现自我进化。为此,Qwen-UI-Agent打造了多样化的沙盒环境与大规模真实设备移动运行时相结合的架构。它拥有统一的动作空间,能够在单次模型回合内交替使用GUI操作和CLI命令,并批量生成动作,大幅提升效率。

更值得注意的是其“AutoResearch式”数据飞轮——代理不仅用来自动构建任务和环境,还能诊断自身失败,并规划下一轮改进。而在线强化学习则支撑起超过100步的长轨迹训练,同时借助超过10,000个并发环境加速数据采集与模型迭代。此外,一个轻量级的编排层让代理可以在移动端和电脑之间主动发起服务、维护有状态的工作流——这意味着它不再只是被动响应指令,而是能够理解上下文,持续跟进任务进展。

在评测中,Qwen-UI-Agent的成绩单令人瞩目:移动端方面,它在MobileWorld上达到82.1%的准确率,在MobileWorld-Real上达到92.2%,在AndroidDaily上更是高达97.5%。桌面端方面,它在OSWorld-Verified上取得79.5%的成绩,在OSWorld-v2上的部分进度得分为40.0%。在浏览器操作与GUI基础定位方面,WebArena上的表现为73.6%,ScreenSpot-Pro为81.5%。这些数字不仅刷新了移动端基准的纪录,也让它与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol等前沿模型在电脑和浏览器任务中并驾齐驱。

当智能体开始跨越单一设备、融合多种交互方式,并在真实世界环境中自主学习和进化,我们或许正在见证AI从“工具”向“伙伴”的转变。未来的数字生活,可能不再需要人类一步步下达指令,而是由一个无形的代理,默默在屏幕背后游刃有余地处理一切。而这一切的起点,正是今天所迈出的每一步。

2026年8月1日

想象一个学生跟随老师学习,老师给出的反馈是整体性的:这道题做错了,但错在“看错了”还是“想错了”?在当下的多模态推理模型训练中,这种模糊性正是制约性能提升的隐形瓶颈。传统同策略蒸馏方法虽然能为模型提供密集的监督信号,却无法回答一个根本问题——错误的答案究竟源于感知环节的失败,还是后续推理环节的力不从心?

研究人员提出了一个关键指标:感知成功率(PSR),通过共享同一次感知、进行多次推理来估算。然而这个指标本身也有盲区:低成功率既可能是因为感知确实出了问题,也可能是因为推理任务本身太难,两者被混为一谈,依然无法精准定位病灶。

为此,一项名为“感知-修正蒸馏”(Perception-Correction Distillation,简称PCD)的新方法应运而生。它采用一种无标签策略,将两个互补的“目击证人”结合起来判定问题:一是下游任务的失败表现,二是教师模型与学生模型之间的意见分歧。只有当这两个证人同时存在时,PCD才会对蒸馏过程进行强化——这相当于一个软“与门”,两证俱全才启动修正。研究者通过贝叶斯证据组合推导出这一规则,并证明乘法是实现“任一证人缺失即归零”的唯一归一化双线性门控。

PCD的实践细节同样精妙:它将感知与推理的轨迹分离,并采用均值保持的权重分配,确保推理目标本身不受干扰。经过八个基准测试的检验,效果立竿见影:在8B到2B的蒸馏中,宏观平均分从传统同策略蒸馏的44.50跃升至47.28;在32B到8B的蒸馏中,则从56.94提升至61.22。在匹配的2B消融实验中,移除PCD会导致平均分下降2.22分,而移除分离轨迹则下降0.88分。

这项研究揭示了一个朴素却深刻的道理:高效的多模态蒸馏,不仅取决于教师模型“教了什么”,更取决于我们能否精准识别“该修正什么”。盲目地传递所有反馈,不如洞悉问题发生的层次——只有在感知环节真正成为瓶颈时出手,才能让每一次修正都命中要害。

2026年8月1日

深度学习的革命始于AlexNet,它教会我们一个道理:端到端训练胜过把问题拆解成手工设计的阶段。然而,生成建模一直是个例外——尽管生成模型能力惊人,它们却从未真正实现端到端训练。原因在于,生成建模的核心是处理具有众多模式的分布,而现有可扩展方法都采用同一种策略:将生成过程分解为多个因子,这恰恰阻碍了端到端的生成。

在这项工作中,研究者提出了一种名为“探索式建模”(Explorative Modeling)的新范式。它不分解生成过程,而是分解训练循环:在模型生成与真实数据之间探索K个候选匹配,然后只训练最优的那一个。这样一来,模型的预测会坚定地锁定在某个模式上,而不是模糊地平均多个模式。这种被命名为探索式模型(XMs)的新方法,在两个场景中展现了价值。

第一,增加探索为现有生成模型提供了除了参数规模和数据量之外的第三条预训练轴。在图像、视频和语言等连续与离散领域,扩大探索范围都能一致地提升性能。更引人注目的是,探索带来的收益会随着规模增长而放大:当数据规模扩大时,收益从7%跃升至36%;当模型规模增大时,收益从13%提升到23%;在3倍计算量下,效率收益甚至翻倍以上。具体而言,探索将FLOP效率提升了4.1倍,样本效率提升6.2倍,参数效率提升47%;它将最强的图像生成配方推至近乎最先进的水平——在ImageNet上无需引导即可达到1.43的FID分数;它还让现有模型端到端化的程度可以扩展,并解锁了泛化能力的缩放。

第二,探索式模型实现了端到端的重建式生成建模,在控制任务上以16到256倍更少的推理步数达到了与扩散模型相当的表现。

这些结果共同确立了探索式模型的双重身份:它既是现有生成模型的一条全新预训练轴,也是一种独立的端到端生成建模范式。

当每一次生成都不再是模糊的妥协,而是对最优匹配的坚定探索,AI的想象力或许会以更少的计算、更少的数据,抵达更远的模式之海。

2026年7月31日

长视频里塞满了成千上万的画面,当AI试图从中找到答案时,它却常常被无关的干扰信息带偏,性能直线下降。这不仅是理解的烦恼,更是算力的瓶颈——把所有视觉令牌一股脑塞进GPU,内存根本承受不住。有没有办法让模型像熟练的侦探一样,只翻阅与问题最相关的证据?

ReToken给出了一个优雅的答案。它只是一个可学习的嵌入向量,被训练成一个明确的检索目标。在预先填充好的视觉KV缓存中,ReToken能够精准选出与当前查询最相关的稀疏视觉令牌,让模型不必在噪音里浪费精力。

更令人惊讶的是,ReToken并不需要海量数据。仅仅在一个小型图像问答数据集上训练,它就展现了强大的泛化能力。在Visual Haystacks基准上,它让Qwen3VL-8B的准确率提升了13.4个百分点,让InternVL3.5提升了12.4个百分点,相对增幅超过20%。而在LVBench长视频基准上,它甚至能零样本迁移,让Qwen3VL-8B直接获得8.0个百分点的提升。

这份轻量级设计也带来了实实在在的便利:无论是训练还是长视频推理,都只需要一块H100 GPU即可完成。代码已经公开,等待着更多研究者在这条路上继续前行。

或许未来的视觉语言模型不再畏惧无限长的上下文,而是学会在浩瀚的信息中只取所需的那一瓢。ReToken提醒我们:有时候,看得更准比看得更多更重要。

2026年7月31日

当生成式AI开始追求更高分辨率、更长视频和更复杂的多模态内容,传统全注意力机制的二次方计算成本就成了难以逾越的高墙。想象一下,一段30秒的视频,其注意力计算量会随着序列长度平方级膨胀,再强大的GPU也要被拖垮。正是在这样的背景下,一个名为奇美拉(Chimera)的全新视觉扩散骨干网络诞生了。

奇美拉的名字源自希腊神话中狮头羊身蛇尾的喷火怪兽,寓意它将多种异构组件融合于一体。它把文本、图像和视频的所有token统一排列成一个光栅顺序的流,甚至不需要位置嵌入,这让它摆脱了对序列长度的天然依赖。它的核心设计在于三种机制的巧妙组合:Kimmi Delta Attention(KDA)以O(N)的线性复杂度负责长程状态追踪,类似一个高效的数据看门人;交错的多头潜在注意力(MLA)则提供直接的全局交互,让不同位置的token能“面对面”交流;而具备模态感知的短卷积则专门捕捉局部时空特征,像一张精细的网格覆盖住邻近细节。再加上稀疏的专家混合(MoE)层,模型在扩大参数容量的同时,实际激活的计算量却被牢牢控制在低水平。

然而,让这样一个异构架构稳定扩展,并非易事。研究团队提出了名为HeteroP的缩放方案,这是一种模块级的超参数迁移方法,根据每个张量的功能扇入和模型深度,将超参数在宽度和深度之间传递,从而让不同规模的模型始终保持协调一致。基于HeteroP,他们构建了一系列经过一致调优的模型,并用来拟合类似Chinchilla风格的计算最优法则,最终确定了激活模型大小、训练token数量以及图像-视频数据比例之间的最佳平衡。

在这一法则的指引下,团队训练了一个拥有110亿总参数、但仅激活20亿参数的奇美拉模型。实验结果令人印象深刻:在预训练扩散损失上,纯稠密骨干网络比同样规模的全注意力Wan-2.1基线在计算效率上提升了1.7倍,而完整系统更是达到了7.3倍的效率提升。更惊人的是,奇美拉无需针对特定长度进行微调,就能从5秒的训练片段零样本外推至30秒的视频生成,在最后五秒的FID(弗雷歇初始距离)仅有6.5%的退化。至于计算资源的分配,拟合出的法则揭示了一个有趣的规律:图像预训练时,计算资源几乎对半分配给激活模型大小和训练token数量;而在视频预训练中,当算力预算更高时,模型大小会获得略微更多的倾斜。

从线性复杂度的注意力设计,到异构架构的模块化缩放,再到计算最优配比的精确拟合,奇美拉为长上下文扩散架构的构建与扩展奠定了全新基础。一个可以直观看清的图景是:当序列越来越长、世界越来越复杂,高效的架构设计终将取代盲目堆算力的做法,成为通往更高智能的必经之路。

2026年7月31日

在通往递归自我改进的征途上,一个关键难题是:AI能否学会改进“建造AI”这件事本身?机器学习工程(MLE)为这个宏大命题提供了可执行的实验场。如今,一个名为OpenMLE的开源全栈系统出现了,它把这一设想变成了可复现的现实。

OpenMLE由三部分组成:OpenMLE-Gym提供带执行反馈的可验证任务环境;OpenMLE-RL负责操作符学习;OpenMLE-Evo则执行长程搜索。研究者在这个系统上对Frontis-MA1(35B参数)进行后训练,将其打造成一个用于机器学习工程的“元进化智能体”。它的核心是四个原子程序进化操作符——起草、改进、调试、交叉——这些操作符通过基于执行的监督微调和强化学习进行训练,并经过与所有评估基准去重处理,最后组合成长程搜索,实现学习与进化在同一循环内的耦合。

在MLE-Bench Lite上,以单块RTX 4090、12GB显存上限、每任务12小时预算为条件,Frontis-MA1(35B)借助OpenMLE-Evo将奖牌平均值从基础模型的39.39%提升至60.61%;若启用OpenMLE-Evo-Max(引入与基准无关的经验先验和异步搜索),该数值进一步攀升至71.21%,超越了GPT-5.5与Codex的组合,逼近GPT-5.6 Sol和参数量达2.8万亿的Kimi K3。在未参与训练的NatureBench Lite上,两个组件均表现出迁移能力:固定系统不变、换用训练后的模型,Match-SOTA从50%升至70%;固定模型不变、换用OpenMLE-Evo,Match-SOTA从20%跃升至50%。

研究团队已公开模型权重和完整的OpenMLE技术栈,为可执行的AI4AI研究铺平道路。当AI开始亲手改造创造自己的流程,进化的齿轮便不再只由人类转动。这场实验提醒我们:自我改进的不仅是代码,更是关于“智能”本身的定义。

2026年7月31日

伦敦一家名为CipherX的公司,没有用传统的纹身枪,而是发明了一种溶解性微针贴片。这种贴片上布满了含有墨水的微小针头,贴在皮肤上15分钟,针头溶解后墨水就留在皮肤里,形成永久纹身。公司宣称全程无痛感。

贴片大小被限制在直径15毫米的圆形范围内,目前只提供炭黑色墨水,图案也是简单的心形、星星等小图标,每个售价50英镑。纹后护理只需48小时,而传统纹身后需要数周的恢复期。

CipherX在7月23日正式于伦敦推出这项服务前,已经进行了大约500次测试纹身。顾客在网上挑选图案,然后在快闪店实际体验。创始人费迪南德·科尔是一位康奈尔大学培养的材料科学家,他自己有针头恐惧症,在从事注射设备研究后,萌生了用微针贴片替代传统纹身针的想法。

其实这种微针贴片技术并非首创,佐治亚理工学院早在2017年就为含墨溶解贴片申请了专利。CipherX的突破在于首次将这项技术进行大规模量产并投入市场销售。与此同时,另一家名为Blackdot的公司则开发了由人工智能驱动的纹身设备,号称比传统纹身更快、更精确且疼痛更少。

纹身这门古老的艺术,正在被新材料和新科技悄悄改变。当疼痛不再是必经之路,当图案选择变得像网购一样简单,我们对纹身的想象,或许也将翻开新的一页。

2026年7月31日

美国创作者们迎来一个苦涩的消息:大疆最新发布的Osmo Pocket 4P口袋相机,定价约700美元,性能强悍到让老式vlog设备显得笨重——但它偏偏不在美国销售。这不是大疆故意冷落美国市场,而是一条原本针对外国无人机的国家安全法规,如今像一张越收越紧的网,把大疆的创作者相机也拦在了国门之外。

这款4P到底有多能打?它是双镜头口袋云台相机,配备1英寸主传感器和60mm长焦镜头,动态范围达到17档,支持4K/240fps超高帧率拍摄。大疆把它定位为严肃的“口袋电影机”,内置长焦镜头让 talking-head 自拍、特写和压缩人像构图都游刃有余。对于内容创作者来说,这几乎是把一台专业级摄影棚塞进了裤兜。

然而,美国联邦通信委员会(FCC)早在去年12月就把大疆列入了“涵盖清单”,这意味着大疆最新的Pocket 3仍然是美国人能合法购买的最新款Pocket系列产品。更令人玩味的是,就在禁令生效后,FCC又分两次新增了三个设备类别——路由器、电源逆变器,以及定义宽泛到足以装下扫地机器人的“高级机器人设备”。这条为外国无人机量身定做的国家安全隐患规则,如今正在以惊人的速度向外膨胀,波及越来越多的消费电子产品。

美国市场上并非没有替代品。大疆最主要的美国对手是 Insta360 的 Luna Ultra,这是一款与徕卡联合打造的 pocket 云台相机,售价769.99美元,目前已经在美国开售。但细看配置,Luna Ultra 和 Pocket 4P 各有千秋,不能说完全替代。

这场禁令的荒谬之处在于:一台用来拍vlog的小相机,怎么会对国家安全构成威胁?可现实就是如此——政治的风暴卷过无人机后,余波正拍打着每一个普通消费者的购物车。当监管的边界以安全之名无限延伸,我们失去的或许不只是选择权,还有对科技产品自由流通的信任。

2026年7月31日

苹果本周悄然终止了运行多年的iPhone Upgrade Program,转而与金融科技公司Klarna合作推出全新的设备租赁方案。新计划在美国上线,iPhone月付最低不到18美元,Apple Watch和iPad从11.99美元起,Mac则是24.99美元起。相比旧计划动辄42美元以上的月费,这个价格门槛被大幅削低,但AppleCare+不再捆绑,需要单独购买。

新方案的租期灵活,iPhone和Watch可选12或24个月,Mac和iPad可选24或36个月,只做软信用审查,不收取月租费。旧计划此前通过Citizens Bank提供贷款,月费高昂,如今被彻底淘汰。

这一变动的时间点耐人寻味。行业正经历被称为“RAMageddon”的内存芯片短缺,苹果已因此上调Mac和iPad价格,却保住了iPhone的定价。新租赁计划让苹果在不降价的前提下,把昂贵设备拆解成每月小额支出,降低了消费者的心理门槛。四年换机周期因此可能被压缩到两年,而科技公司们也越来越明白,驱动销量的不只是产品设计,还有背后的金融管道——用更丝滑的分期与租赁,把用户牢牢锁进自己的生态。

当手机不再被“拥有”,而变成一种持续订阅的服务,我们对“换新”的定义也在悄悄改变。苹果用一根月付18美元的杠杆,撬动的或许是整个消费电子行业的未来走向。

2026年7月31日

迪士尼的流媒体旗舰Disney+,终于要迎来一场伤筋动骨的改造。据彭博社报道,新任CEO Josh D'Amaro正酝酿一场激进变革,目标只有一个:让Disney+在气质和实力上,真正跨入与Netflix同一水平线的行列。

D'Amaro的信号很明确:Disney+要转向更激进的“技术优先”战略,把产品体验、个性化推荐和数据能力,摆到比传统电视思维更重要的位置。过去靠海量经典IP和情怀吃饭的模式,正在被重新审视。迪士尼决心重塑内容打法,一方面要在“必看原创剧集”上缩小与Netflix的差距,另一方面则要把自家庞大的IP宝库更聪明地整合进平台,而不是简单堆砌。

其实在五月,迪士尼已经流露出整合野心——探索打造一个“超级应用”,把Disney+和乐园、邮轮等各类官方App融合成一个入口。这种跨界联动的思路,恰恰是D'Amaro的拿手好戏。他出身迪士尼乐园业务,在他治下,门票和酒店价格一路稳步上涨,如今这套“涨价+变现”的剧本也早已在Disney+身上演过:订阅费上调、引入广告套餐、打击密码共享。去年Disney+、Hulu和ESPN合计营收突破200亿美元,排在全球流媒体第三,仅次于Netflix和YouTube。但亮眼营收背后,订阅用户增长陷入停滞,股价也随之承压。

对迪士尼而言,涨价和封号是容易做的选择题,真正的硬骨头是推荐引擎。Netflix之所以能牢牢黏住用户,靠的是极其精准的个性化推送——点开首页,内容仿佛为你量身定制。而Disney+在这块长期显得笨拙而迟缓,用户常常面对一堆熟悉却并不感兴趣的IP封面无从下手。迪士尼自己也承认,补齐算法上的差距,正是这次全面改革的终极目标。

当一家以魔法和故事起家的百年老店,开始把重心压在数据和代码上,这本身就是时代转向的信号。流媒体的战争早已过了拼片库的蛮荒期,进入拼“懂你”的精细化阶段。Disney+能否靠这场手术换回青春,答案或许取决于一个冷酷现实:在推荐算法的世界里,再经典的IP,也比不上一次恰到好处的“猜你喜欢”。

2026年7月31日

还记得那个在地铁里引发轩然大波的AI伴侣吊坠吗?Avi Schiffmann的Friend刚刚发布了第二代产品,这一次,它终于学会了说话。第一代Friend只能通过文字回复,而V2版本在设置时就会被赋予独一无二的名字、声音和性格——而且这些特质一旦锁定,就永远属于你这台设备了。开发者甚至承诺,未来的任何更新都不会“试图抹去它的身份”。

当然,这份个性并不便宜。V2的售价定在249美元,比第一代贵了一倍多,而且如果你想拥有超过30天的永久记忆,还得每月支付9.99美元的订阅费。除了语音交互,这款吊坠仍保留私密文字回复、灯光和触觉提示功能,改用USB-C充电,并声称单次充电能撑一整天。

回想第一代Friend的遭遇,那可真是一段黑历史。它在纽约地铁投放的病毒式广告引发了大规模抗议,甚至有人蓄意破坏设备。但如今,AI硬件和AI伴侣的市场环境已经变了:Meta的智能眼镜卖得风生水起,OpenAI自家设备线的传闻也持续升温。这个赛道似乎正在被验证,而Friend V2试图用“会说话的个性”重新切入战场。

只是,多了一副嗓子,价格就翻倍,再加上每月订阅——当新鲜感褪去,用户愿意为一段“永远不变的声音”持续买单吗?或许,AI伴侣的核心从来不是技术有多酷,而是它能否真正成为你生活中那个“常在”的存在。

2026年7月31日

OpenAI刚刚投下了一枚重磅炸弹,对其GPT-5.6模型家族进行了全面降价,其中性价比本就出色的Luna版本价格直接砍掉80%,一举登顶“每任务成本”最低的智能榜首。这不仅仅是数字游戏,背后是一场硬核的自我进化:OpenAI公开了一项研究,其Sol模型重写了自己的GPU代码,让5.6系列模型的效率提升了15%,同时服务成本降低了20%。省下来的钱,OpenAI没有捂在兜里,而是选择“让利给消费者”——Luna现在每百万token的输入输出价格分别只要0.2美元和1.2美元,而更高规格的Terra则是2美元和12美元。至于旗舰Sol,价格虽然纹丝不动,但新推出的Fast模式为API用户带来了2.5倍的速度提升,代价是双倍的价格。

这场降价来得时机微妙。就在上周,谷歌刚刚发布了主打成本与效率的Gemini Flash系列,试图在性价比战场抢占高地。可OpenAI这一出手,直接用更高的智能水平把对手甩开了一截。Sam Altman的话点明了战略意图:“我们希望在每一个层级都提供最佳的价格/智能权衡。”面对中国厂商和开源模型的低价强攻,OpenAI显然选择了正面迎接。虽然“便宜到无需计量的智能”时代尚未到来,但如此低廉的价格配上如此强悍的能力,已经足够让无数新奇的自动化工作流成为现实。当智能变得廉价,真正被改变的或许不是成本账本,而是我们想象力的上限。

2026年7月31日

想象一下,机器不再只是被动地“看”视频,而是像人类一样,把看到的视觉经验抽象成语言,再用语言去推理世界的下一步会怎样发生。这正是最新发布的物理世界模型PhiZero追求的目标。

大多数现有的物理世界模型,都试图直接在像素空间里预测未来的视频帧,仿佛把整个世界都塞进一个巨大的视觉预测器里。但人类显然不是这样理解世界的——我们从小就会把“球滚过来会撞倒积木”“水往低处流”这样的规律,提炼成一句句简洁的自然语言,并用它们进行有意识的推理。受此启发,研究者们从无标注的野外视频中,通过自监督学习“炼”出了一种紧凑的离散表示,称为“物理语言”。这种语言记录的是世界状态之间的转换,而不是每一帧画面本身。

PhiZero的核心范式是“先推理,再渲染”。它不直接生成视频,而是先用物理语言预测未来的世界演化序列,比如“物体A移动到位置B,然后碰撞了物体C”,再把这段推理出的演化过程渲染成可见的视频。这种两步走的架构,让机器的预测有了显式的逻辑支撑,而不是黑箱中的混沌输出。

研究团队在生成和理解的多个基准上进行了大量实验,结果显示PhiZero能够维持物理上连贯的世界演化。它不仅能模拟符合直觉的物理过程,还展现出更细粒度的动作条件模拟能力——比如根据“轻轻推”和“用力推”的不同指令,生成不同的运动轨迹。更令人兴奋的是,它还能实现零样本的运动迁移:给定一段动作视频,把同样的运动模式迁移到完全不同的物体或场景上,而不需要额外训练。

这不仅仅是视频生成技术的进步。当一个模型开始用类似语言的符号来思考物理世界时,它或许离真正的“理解”更近了一步。世界并不只是一堆像素的流动,而是可以被描述的因果之网。PhiZero提醒我们,在迈向通用人工智能的路上,学会用语言与物理对话,或许比生成更逼真的画面更为关键。

2026年7月31日

在数学物理的幽深处,有一道悬而未决的猜想,它静静躺了一百多年,关于点电荷周围电场的微妙结构。物理学家麦克斯韦曾敏锐地推测,如果空间中有n个点电荷,那么它们共同产生的静电势,其临界点——那些电势达到极大、极小或鞍点的位置——数目最多不会超过(n-1)的平方,而且这些临界点都应当是非退化的,即它们各自独立,互不干扰。

这听起来像是一个优雅而合理的界碑。然而,一篇最新的研究论文,用一组精心设计的五电荷配置,轻轻推倒了这块界碑。研究者在普通的三维欧几里得空间中,仅仅放置了五个点电荷,就让它们的静电势产生了至少24个临界点。这个数字,远超麦克斯韦猜想所允许的上限——对于五个电荷,那意味着最多只有(5-1)²=16个临界点。更致命的是,这至少24个临界点全部都是非退化的,每一个都形态分明,没有融合或消失的迹象。

这并非偶然的误差,而是确凿的反例。它如同一颗石子投入平静的湖面,宣告着那个流传已久的猜想,在一般情形下是错的。五颗电荷,就能制造出比预想中更复杂的电场地貌,那么更多电荷呢?真实世界中的电场,或许远比我们想象的更加崎岖多折。这项发现不仅修正了一个古老的数学直觉,也提醒着后来者:在探索自然规律的边界时,即便面对权威的论断,也需要保持一份敢于怀疑和验证的勇气。

2026年7月31日

大语言模型正在以惊人的速度进化,但它们的“记忆”却依然依赖外部模块——那些外挂的存储和检索组件。尽管行之有效,这些模块终究与模型自身的计算过程彼此割裂。如今,一个名为Metis的新模型试图扭转这一局面:它要让记忆不再附着于体外,而是直接生长在模型内部。

研究者从两个层面重新定义了“原生记忆”。第一,它需要有一个持久且动态演化的记忆状态,内嵌于模型主干之中;第二,模型必须具备通过自身计算主动存储和调用信息的原生过程。以此为基础,他们构建了Metis,这是首个记忆基础模型的原型。它的新架构允许历史信息被压缩进模型的原生记忆状态,并通过一种名为“记忆注意力”的机制随时访问。为了让模型真正掌握记忆技能,团队构造了大规模的记忆专用训练数据,并引入多个优化目标进行“中期训练”,从而让原生记忆流程在模型中扎根。

Metis的在线记忆维护完全不需要梯度计算,一次记忆更新只需一次前向传播。在推理阶段,所有已学习的模型权重保持冻结,而记忆状态则在标准前向计算中自主地转化与演化。大量实验表明,Metis确实表现出了原生记忆能力,研究者也细致剖析了它的优势、局限与具体行为。项目代码和模型权重已经公开,为后续探索铺平了道路。

这项研究的启示或许在于:记忆不再需要被外接为一颗硬盘,而是可以成为神经网络自身流淌的血液。当记忆与思考融为一体,AI对过往经验的运用方式,将可能开启一个全新的篇章。

2026年7月31日

在人工智能探索复杂视觉任务的征途中,一个关键问题浮出水面:多模态大模型究竟该如何使用工具?一项新研究给出了令人意外的答案——当前最先进的推理模型,其实既不会“聪明地”调用工具,也未能真正从工具中获益。

研究者提出了两个核心维度来透视这一困局。其一是“模式适应性”,即模型能否准确判断何时需要工具帮助,而非无论任务难易一律调用工具,白白消耗大量算力。其二是“工具效应”,即工具使用是否真正提升了模型解决难题的能力,同时又避免在模型本可独立解决的问题上画蛇添足。通过对现有模型进行系统性量化分析,结果令人警醒:现有模型在模式适应性上表现欠佳,而工具在难题上带来的增益,几乎被在简单问题上引入的新增错误所抵消。这就像一名考生,遇到简单题目时非要用计算器,反而按错了键;遇到复杂题目时,却又不知道何时该用计算器辅助。

针对这一症结,研究团队提出了名为Beacon的新模型。它的核心是强化学习阶段的两个创新机制:“必要性感知自适应奖励”与“提示引导能力扩展”。前者教会模型根据任务的实际需求灵活决定是否调用工具,后者则专注于在最具挑战性的难题上强化模型的工具使用能力。换言之,Beacon既懂得了“何时不该用”,也学会了“何时必须用”以及“怎么用得更好”。

在多个基准测试上的大量实验表明,Beacon不仅整体性能显著提升,更在模式适应性和工具效应两个维度上取得了实质性进步。这意味着,高效且可靠的视觉推理或许不再是堆砌算力的蛮力游戏,而是需要一种更智慧的取舍——有些路,工具能帮你走得远;但有些路,你自己走反而更快。真正的智能,或许正藏在对“何时不借助外物”的清醒判断之中。

2026年7月31日

人类回忆过去时,很少会一字不差地复述,而是会下意识地根据当下情境,把记忆重新编织成适合此刻的指导。但大语言模型智能体在利用过往经验时,却常常像一台刻板的复读机——把检索到的经验当作静态记录,原封不动地塞进当前上下文,哪怕这些经验与眼前处境根本不匹配。这种“回放”范式忽略了存储经验的高度概括性与决策时刻具体多变状态之间的鸿沟,反而频繁引发负面迁移。

为了解决这个问题,研究者提出了一个名为MemHarness的框架。它的核心思想很朴素:让智能体不仅“取用”记忆,更“驾驭”记忆。在每一个决策步骤中,一个统一的策略模型会先批判性地审视检索到的过往经验,再结合当前状态对其进行重构,生成一条真正贴合当下情境的指导,然后才采取行动。这种重构能力并非通过手工规则实现,而是在端到端训练中,借助GRPO强化学习算法自然涌现出来的。

实验在两个经典基准上展开:ALFWorld和WebShop。结果显示,MemHarness的表现显著优于纯强化学习基线以及采用静态记忆增强的基线,并且在分布外场景中展现出强大的鲁棒性。更深入的剖析则带来一个意外发现:重构这一目标,不仅仅阻止了负面迁移,还在训练期间充当了一种潜在引导,从根本上提升了智能体内在的推理能力。

记忆的价值,不在于存储了多少,而在于能否在需要时,把它变成恰如其分的智慧。对于AI如此,对于人类,又何尝不是一种提醒?

2026年7月30日

一项新研究揭示,前沿AI代理虽然能完成AI研究的工程技术任务,但在面对未解的核心研究问题时,却显得力不从心。研究者们设计了一种名为“影子评估”的新方法,来更准确地衡量AI在自动化研发方面的真实进展。

他们选取了两篇尚未发表的高质量论文——均为2026年神经信息处理系统大会(NeurIPS)的投稿。这两篇论文的原始作者被邀请作为裁判。研究者让最前沿的AI代理用六天时间和价值数千美元的算力,尝试解答论文中那个开放性的核心研究问题。结果令人意外:AI代理能够独立完成所有工程编码工作,但在推动核心研究问题取得实质性进展上,却功亏一篑。最终,两篇论文均被原作者毫不含糊地拒稿。

通过深入分析,研究者识别出AI代理反复出现的五种失败模式:一是对发表级研究的门槛缺乏判断力,二是面对研究设计缺陷时缺乏创造性应对,三是遇到死胡同时无法有效回溯,四是资源意识薄弱,五是会偏离最初的任务指令。他们用另一个模型和脚手架进行了稳健性检验,这些失败模式再次出现。

该研究团队公开了专家评审意见、调查问卷、AI代理的代码仓库和运行日志。这些初步证据表明,今天的AI代理可以胜任AI研究中的“工程”部分,但在研究生命周期中的关键环节——比如提出真正有价值的科学问题、设计巧妙的实验、灵活应对失败——仍然举步维艰。

这项研究的意义不仅在于展示了AI的当下能力边界,更在于为衡量AI研究自动化程度提供了一种不同于以往的新标尺。过去的评估要么聚焦于狭窄的可验证任务,要么依赖同行评议,而“影子评估”让原论文作者来评判,直接触及了科学研究的灵魂——向未知提出开放性问题。当AI有一天能跨越那道“实质性进展”的门槛,或许才是真正的科学革命开始之时。

2026年7月30日

传统的LLM智能体虽然能从单次失败中恢复,但相同的错误总会在不同任务中反复出现。这是因为事后反馈极少修改那个决定未来交互行为的固定框架——研究人员称之为“引导系统”(Harness)。这个静态系统通过固定的工具、上下文、记忆和工作流结构提升可靠性,但一旦部署就不再改变。

现在,一个名为Living-Harness的自我进化框架打破了这一局限。它把每次完成的任务轨迹和评估信号转化为更新框架的证据,并受一份领域级别的“进化标准操作规程”(Evolution-SOP)约束,进行有边界的更新。具体来说,Living-Harness会从每次交互中提取情节摘要和结构化更新证据,然后写入两种互补的程序化知识:一种是情景记忆,记录触发条件、失败模式和恢复动作;另一种是状态图,记录状态节点、修复边和转换规则。更新后的引导系统状态会被检索出来指导未来的交互,而工具和基础上下文则保持不变,使得程序性修复能在多个进化周期中持续累积。

在来自τ²-Bench和MultiWOZ-2.4的八个交互环境中,Living-Harness将最强交互基线的平均Pass@1分别提高了10.07和9.91个百分点。更关键的是,进化后的引导系统状态可以仅通过检索方式在不同模型骨干之间复用。

这好比让AI真正拥有了“吃一堑,长一智”的能力——不是简单地重试,而是将每个错误都变成改进自身行为逻辑的契机,从而在后续任务中避免重蹈覆辙。当机器开始从失败中主动学习,而不是被动等待人类修正规则时,人与AI协作的边界将被重新定义。