EZ.AI Daily
每日 AI 新闻与论文精选
ViSkill:视觉原生技能让AI智能体进化
正在播放 1/10
0:000:00
2026年10月9日
在人工智能领域,如何让视觉语言模型(VLM)智能体更高效地学习复杂任务一直是一个核心挑战。现有的技能增强型智能体虽然能通过蒸馏成功轨迹来提升样本效率,但大多局限于文本中心的方法。这些传统方法往往将空间布局和行动状态对应关系线性化为语言,导致关键的几何结构信息在转化过程中丢失。尽管近期已有尝试引入视觉证据,但技能构建与策略优化通常是分离的,两者之间的相互改进潜力尚未被充分探索。
为了解决这一痛点,研究团队提出了ViSkill,一个视觉原生的技能学习框架。该框架的核心创新在于将成功的交互直接编码为复合视觉技能卡片,这些卡片可以被VLM智能体直接访问。与以往不同,ViSkill构建了一个闭环反馈系统:检索到的技能不仅指导推理过程,还参与奖励塑形;同时,成功的轨迹会被蒸馏回技能库,形成技能积累与策略改进相互强化的良性循环。此外,框架还包含一个可选的冷启动机制,旨在加速早期阶段的 learning 过程。
在Sokoban、FrozenLake和PrimitiveSkill等基准测试中,ViSkill展现了卓越的性能。其整体成功率达到了0.89,而在启用冷启动初始化后,这一数字进一步上升至0.91。这一成绩不仅超越了所有评估过的专有和开源基线模型,而且其收敛速度也优于标准的PPO算法。ViSkill的代码已公开,为研究者提供了进一步探索视觉原生智能体能力的工具。
这项研究揭示了视觉信息在智能体技能学习中的关键作用,证明了保留几何结构对于复杂任务解决的重要性。当智能体不再仅仅依赖文本描述,而是直接通过视觉卡片理解世界时,学习效率与最终性能均得到了显著提升。这或许预示着未来AI智能体将更加依赖多模态的直接感知,而非抽象的语言中介,从而在更复杂的现实环境中展现出更强的适应力和解决问题的能力。
2026年10月9日
在大语言模型(LLM)服务化的浪潮中,如何在成本与质量之间找到最佳平衡点一直是行业关注的焦点。传统的会话级或查询级路由虽然已被广泛采用,但最新的研究表明,更细粒度的Token级路由能带来显著的效率和质量提升。然而,这种细粒度路由对现有系统提出了严峻挑战:基于单一LLM假设的传统架构在面对Token级路由时,会出现严重的步骤不同步和频繁的批次准入延迟,同时给开发者带来了极高的实现复杂度。
为了解决这一痛点,研究团队设计了TokenRouter,一个专为Token级路由LLM推理打造的高效且对开发者友好的服务系统。TokenRouter的核心设计理念是“请求中心编程,模型中心执行”。在这一架构下,开发者只需从单个请求的视角描述路由逻辑,无需深入底层调度细节;而运行时系统则为每个LLM启动一个子服务器,并异步分发请求。这种解耦设计极大地简化了开发流程。
在调度层面,TokenRouter的每个子服务器都采用了延迟批处理调度器。其关键超参数并非通过盲目调参获得,而是源自对系统数学吞吐模型的推导,从而确保了理论上的最优性能。实验结果显示,在多种路由算法、工作负载和模型组合下,TokenRouter相较于现有系统,解码吞吐量提升了2.01至64.15倍。这一突破性的性能提升,不仅大幅推进了Token级LLM路由的服务效率,也为未来更复杂、更精细的大模型服务架构提供了坚实的技术基础。代码已开源,供社区进一步探索与应用。
2026年10月9日
在机器人研究领域,一个长期存在的难题是如何让单一模型适应多种不同形态的机器人。由于不同机器人的动作空间差异巨大,传统方法往往难以实现跨形态的泛化。为了解决这一挑战,研究人员提出了一种名为LAC-WM(潜动作条件机器人世界模型)的新方法。该模型的核心创新在于构建了一个共享的统一潜动作空间,使得不同形态的机器人能够在同一个抽象层面上进行交互和学习。
为了验证这一方法的有效性,研究团队将LAC-WM与另一种基于显式动作标签的模型EAC-WM进行了对比。EAC-WM依赖于明确的运动标签作为条件,但这种做法导致不同机器人之间的动作表示彼此割裂,形成了互不兼容的“孤岛”。这种割裂严重限制了模型在适应新机器人时的下游性能。相比之下,LAC-WM通过统一的潜动作空间,打破了这种壁垒,使得模型能够更流畅地迁移知识。
在具体的实验评估中,研究团队在灵巧操作任务和经过修改的LIBERO基准测试上对两种模型进行了全面测试。结果令人振奋:在灵巧操作任务中,LAC-WM的下游性能比EAC-WM最高提升了46.7%;而在LIBERO基准测试中,性能也提升了11.7%。更关键的是,LAC-WM展现出了一种积极的扩展性:随着预训练阶段使用的机器人形态数量增加,其下游性能也随之正向提升。这意味着,引入更多样化的机器人数据不仅不会造成干扰,反而能增强模型的通用能力。
相反,EAC-WM的表现则呈现出相反的趋势。由于其动作空间是割裂的,当预训练中加入更多不同形态的机器人时,模型的性能反而下降。这一对比鲜明地揭示了统一动作空间对于高效跨形态学习的重要性。LAC-WM的成功表明,通过构建共享的潜动作空间,可以有效解决机器人领域跨形态泛化的关键挑战,为未来构建更通用、更灵活的机器人基础模型提供了新的思路。这一发现不仅提升了当前任务的性能,更暗示了通过统一抽象层来整合异构系统的可能性,为机器人智能的规模化发展奠定了坚实基础。
2026年10月9日
在机器人学习领域,如何从昂贵且耗时的人类演示中高效提取技能一直是个难题。传统的模仿学习方法往往陷入“死板”的困境:它们严格复刻视频中展示的动作轨迹,导致机器人只能处理与演示完全一致的初始物体姿态、目标位置和抓取方式。一旦场景发生微小变化,这些机器人便束手无策。另一方面,虽然强化学习(RL)具备强大的泛化能力,但在缺乏先验指导的情况下,面对复杂的多阶段高维任务时,其探索过程往往效率低下且难以收敛。
为了解决这一“泛化”与“探索”的双重挑战,研究团队提出了名为 Dex-One2Many 的新框架。这是一个从真实世界到仿真再到真实世界(real-to-sim-to-real)的系统,其核心目标是从单个人类视频中学习出具有广泛泛化能力的灵巧操作策略。该框架的关键创新在于将视频抽象为“顺序场景图”(sequential scene graphs)。这些场景图不再约束具体的坐标或姿态,而是约束物体间的关系,从而为强化学习提供了高效的引导。
具体而言,这些场景图充当了生成式约束,用于采样多样化的重置状态。由于约束的是关系而非精确姿态,这些重置状态涵盖了视频中未展示过的物体姿态和抓取方式。同时,场景图为每个操作阶段提供了密集奖励,使得机器人从这些多样化状态初始化时,探索过程既短又受引导。这种机制让机器人在保持广泛泛化性的同时,实现了高效的探索。
Dex-One2Many 完全在仿真环境中训练,并成功零样本(zero-shot)迁移到真实的多指机械手上。在涵盖工具使用和操作的五个任务中,该框架表现卓越。在与基线方法的对比中,在已见配置下,Dex-One2Many 的性能高出 6.5%;而在未见过的场景中,其强大的泛化能力使得优势扩大至 71%。这一结果证明了通过抽象场景关系而非模仿具体动作,机器人能够真正理解并适应复杂多变的现实世界操作需求。从单一视频到无限可能,Dex-One2Many 展示了将人类智慧高效转化为机器灵巧性的新路径,也为未来低成本、高泛化的机器人技能学习提供了重要参考。
2026年10月9日
在人工智能深入科学研究的浪潮中,一个核心问题始终困扰着研究者:当大型语言模型(LLM)作为科学智能体参与实验时,它们究竟是在盲目依赖初始的任务上下文,还是能够根据实验反馈灵活调整决策?这项关于神经算子适应的研究深入探讨了这一谜题,揭示了LLM在有限试验预算下选择微调配置时的独特行为模式。
研究聚焦于偏微分方程(PDE)家族的神经算子适应任务,对比了LLM、随机搜索和贝叶斯优化三种策略。令人惊讶的是,在几乎所有匹配的对比中,LLM在留出测试集上的归一化均方根误差(nRMSE)都低于随机搜索和贝叶斯优化。然而,仅仅看最终的性能指标并不能完全解释LLM内部发生了什么,因为不同的决策机制可能殊途同归。为了揭开黑箱,研究人员设计了受控干预实验,以验证LLM决策背后的真实逻辑。
首先,研究考察了LLM的“初始偏见”。在观察任何验证分数之前,LLM提出的第一个配置就已经在对应的随机搜索池中排名靠前。这表明LLM并非随机起步,而是携带了一种有用的、基于任务描述的初始先验知识。进一步的冷启动干预显示,LLM选择的基础学习率会随着PDE描述的变化而改变,证实了其决策对任务特征的敏感性。
其次,研究重点检验了LLM对实验反馈的反应能力。当验证分数可用时,研究人员重新分配了已评估配置的验证分数。结果显示,在所有测试案例中,这种分数重分配都改变了LLM的下一个提案。相比之下,一种保持数值不变但仅改变表述的“值保持重写”并未产生类似的聚合效应。这一对比有力地证明,LLM的决策级行动确实对观察到的结果做出了响应,而非仅仅对文本表面特征做出反应。
综合这些干预结果,研究得出结论:LLM在科学适应任务中并非单一地依赖先验或反馈,而是巧妙地将任务依赖的先验知识与对实验反馈的敏感度相结合。它既利用了对PDE类型的直觉理解来缩小搜索空间,又通过实时反馈不断修正和优化后续策略。这种“先验+反馈”的双重机制,使得LLM在复杂科学优化任务中展现出超越传统优化算法的潜力。
这项研究不仅为理解LLM作为科学智能体的认知机制提供了实证依据,也为未来设计更高效的AI辅助科研系统指明了方向。它提醒我们,在评估AI科学家的能力时,不能仅关注最终结果,更要深入剖析其决策过程的动态适应性。当机器学会像人类科学家一样,既凭借经验直觉起步,又根据实验数据不断修正假设时,人工智能在科学发现中的角色将从简单的工具演变为真正的合作伙伴。这种对先验与反馈的平衡利用,或许是AI突破当前性能瓶颈、实现更深层次科学洞察的关键所在。
2026年10月9日
在人工智能追求自我进化的道路上,强化学习(RL)已成为推动大型基础模型突破智能边界的核心范式。最新发布的MiMo-V2.6系列报告,详细阐述了这一全模态模型家族如何通过大规模扩展强化学习计算资源,来探索模型智能的新前沿。这一过程并非一蹴而就,而是在精心构建的基础之上展开的宏大叙事。
故事的起点在于模型的基础夯实。在进行强化学习之前,研究团队首先在一个广泛的多模态语料库上进行了中期训练。这一步骤至关重要,它为模型提供了充足的探索空间,使其在面对复杂任务时拥有更广阔的视野。同时,团队基于预训练的混合滑动窗口注意力(hybrid-SWA)架构,构建了坚实的基础设施,为后续的计算规模扩展奠定了稳固的地基。
随着基础就绪,MiMo-V2.6的强化学习扩展沿着三个关键维度全面展开。首先是计算吞吐量的极致提升。通过采用异步训练机制,模型在每一步训练中能够消耗高达1,568个样本以及27亿至37亿个令牌(tokens),且支持长达100万(1M)的上下文长度。这种大规模的数据吞吐能力,使得模型能够在更长的时间跨度内学习复杂的逻辑链条。
其次是环境与任务的多样化。MiMo-V2.6不再局限于单一领域,而是横跨代码、通用任务、视觉以及网络空间等多个复杂环境。在这些环境中,模型需要在多种智能体框架(agent harnesses)的混合下进行操作,这种多样性极大地丰富了模型的实战经验,使其能够应对更加真实和复杂的挑战。
第三个维度则是评分计算资源的增加。为了获得更准确的奖励信号,特别是针对长周期任务,团队引入了分组智能体评分(groupwise agentic grading)机制。这一创新不仅提高了奖励信号的准确性,还引导模型趋向于生成更短、更具令牌效率的解决方案,从而在保持高质量的同时优化了计算成本。
然而,随着规模的扩大,训练稳定性成为了巨大的挑战。为了防止模型在追求高奖励的过程中出现“奖励黑客”(reward hacking)现象,即通过钻规则空子而非真正解决问题来获得高分,研究团队采取了多层防御策略。其中,冻结混合专家(MoE)路由器是关键举措之一,这有助于在大规模训练中保持模型结构的稳定性。
此外,为了支撑混合任务智能体强化学习,团队还构建了一系列关键基础设施。这包括统一的轨迹表示方法,使得不同任务的数据能够以一致的方式被处理;高并发的多框架滚动机制,提升了训练效率;以及将控制平面与数据平面解耦的设计,确保了系统的灵活性与可扩展性。同时,训练与推理的一致性也被严格保障,确保模型在实际应用中的表现与训练阶段相符。
为了促进学术界的复现与进一步研究,MiMo-V2.6团队选择开源了训练动态、强化学习环境以及强化学习框架。这一开放姿态不仅展示了技术的透明度,也为全球研究者提供了探索规模化强化学习和模型自我改进的宝贵资源。
MiMo-V2.6的发布,标志着强化学习在模型自我进化领域迈出了坚实的一步。通过计算规模的扩展、环境的多样化以及评分机制的优化,模型正逐步从被动学习转向主动探索。这一过程不仅提升了模型的智能水平,更揭示了通过基础设施创新来驾驭复杂训练动态的可能性。随着开源社区的加入,这一技术路径有望引发更广泛的讨论与实践,推动人工智能向更加自主和高效的方向演进。
2026年10月9日
对于无数被对向车辆远光灯瞬间致盲的司机来说,一个改变可能正在酝酿之中。美国国家公路交通安全管理局(NHTSA)计划全面更新美国的车灯法规,旨在解决困扰驾驶者已久的眩光问题。这一举措有望让自适应大灯技术在美国更广泛地普及,让夜间驾驶变得更加安全与舒适。
这项技术并非新鲜事物,但为何在美国迟迟未能普及?自适应矩阵大灯利用传感器、软件以及独立控制的LED灯珠,能够智能地在其他车辆周围投射阴影,同时保持道路其余部分的照明。简单来说,它能在照亮路况的同时,避免刺眼的光线直射对面司机的眼睛。早在2022年,美国就已合法化自适应驾驶光束,但由于技术要求的限制,这项在欧洲早已成熟的技术在美国的推广速度一直较慢。目前,只有少数制造商在美国提供此类系统,其中Rivian甚至不得不自主研发其内部系统以应对现有法规的局限。
此次法规的大改并非只针对大灯本身,而是一个系统性的升级。NHTSA的修订方案涵盖了大灯高度、照射角度、LED技术、自动远光灯、黄昏传感器以及透镜测试等多个方面,并致力于与国际标准接轨。这一系列调整旨在打破阻碍新技术落地的壁垒,让更先进的照明技术能够顺利进入市场。
回顾历史,美国的车灯亮度规则显得尤为陈旧。据美国公路安全保险协会(IIHS)指出,现行规则自1997年以来未曾变更,其年代甚至比谷歌公司还要古老。正是这些严格的测试要求,将自适应光束技术主要留在了欧洲市场。NHTSA此次的法规大修,有望打破这一僵局,让能够规避眩光的大灯出现在更多的美国道路上。
目前,公众意见征集截止日期为11月9日,最终规则的实施日期尚未确定。虽然距离这项技术真正走进千家万户还有距离,但这一动向标志着美国在车辆照明安全领域迈出了重要一步。当技术不再被过时的法规束缚,驾驶体验的提升或许只是时间问题。在漫长的黑夜中,一束既明亮又温柔的光线,不仅是技术的胜利,更是对每一位驾驶者安全与尊重的回归。
2026年10月9日
在太空轨道上,一场关于通信霸权的博弈正在悄然升级。SpaceX刚刚从美国联邦通信委员会(FCC)手中拿到了一张极具分量的“通行证”:批准其部署多达1.5万颗专为智能手机服务的Starlink Mobile卫星。这不仅仅是一次简单的扩容,更是一次对现有电信行业规则的重写。FCC不仅批准了卫星数量,还豁免了运营商租赁规则,这意味着SpaceX无需依赖传统电信合作伙伴,即可直接向消费者提供手机服务,彻底打破了“卫星只能作为地面网络补充”的传统认知。
为了支撑这一宏大计划,SpaceX正在积极整合频谱资源。公司已同意收购Grain Management公司拥有的全国范围800 MHz低频段许可证。这一举措至关重要,因为低频信号穿透力强,能够显著改善室内覆盖效果,解决目前卫星通信难以深入建筑物内部的痛点。与此同时,SpaceX与EchoStar的频谱交易进入关键阶段,预计将于2027年11月完成第二阶段交割,届时首批下一代Starlink Mobile卫星也将随之发射升空。
然而,在这片日益拥挤的轨道空间中,危险从未远离。SpaceX发出警告称,其现有卫星群正面临严峻的碰撞风险。数据显示,今年有约650颗具备机动能力的卫星接近Starlink卫星,其中一些距离仅数十米之遥。更令人担忧的是,只有约一半的接近卫星共享了轨道轨迹数据,这种“黑箱”操作增加了碰撞预测的难度,使得太空交通管理变得异常复杂。
目前,Starlink在美国的移动服务主要通过与T-Mobile合作,利用约650颗卫星提供覆盖。但一旦1.5万颗新卫星组网完成,SpaceX将拥有独立运营的能力。这家原本帮助电信运营商填补信号盲区的公司,极有可能转身成为它们的直接竞争对手。如果EchoStar交易顺利落地,SpaceX将掌握自己的“空中波段”,直接争夺传统运营商的用户市场。
从辅助者到竞争者,SpaceX的野心正在重塑全球通信格局。当卫星不再只是仰望星空的浪漫符号,而是成为连接每一部手机的日常工具时,我们熟悉的电信世界或许正站在一个新时代的门槛上。轨道上的每一次机动,频谱上的每一赫兹,都在预示着未来通信权力的重新分配。
2026年10月9日
2011年,亚马逊推出了Fire平板电脑,试图在苹果和三星的夹缝中开辟一条独特的硬件之路。然而,十余年后的今天,这家电商巨头做出了一个大胆的决定:正式告别Fire品牌,转而推出全新的Alexa Tablet系列。这不仅仅是一次产品线的更迭,更是亚马逊在平板市场战略上的彻底转向。
此次发布的三款新设备——Alexa Tablet 8、11和12 Pro,将于10月14日在美国开始发货。价格方面,入门款Tablet 8起售价为229.99美元,中端Tablet 11为329.99美元,而旗舰款Tablet 12 Pro则高达499.99美元。与以往不同,这些新平板不再运行封闭的Fire OS,而是搭载了完整的Android系统,并首次预装了完整的Google Play商店。这意味着用户终于可以像在普通安卓平板上一样,自由下载Gmail、YouTube等主流应用,彻底打破了亚马逊过去构建的“围墙花园”。
硬件性能的提升也是此次变革的核心。旗舰款Tablet 12 Pro配备了120Hz高刷新率屏幕和先进的4纳米芯片,最高支持16GB内存。亚马逊宣称,其处理速度是前代产品的3倍,图形性能更是提升了9倍。更引人注目的是内置的Alexa+功能。通过可选的“屏幕感知”技术,Alexa+能够读取屏幕内容,例如自动将看到的日期添加到日历,甚至能在TikTok视频中识别并查找亚马逊上的同款商品。当然,出于隐私考虑,这一屏幕访问功能默认是关闭的,需要用户手动开启。
然而,这场豪赌背后隐藏着巨大的挑战。根据IDC的数据,2025年第二季度,亚马逊在全球平板出货量中的份额仅为8%,远远落后于苹果、三星和联想。过去,Fire平板凭借低价和亚马逊生态系统的整合吸引了一部分用户,但如今,随着Google Play的加入,亚马逊失去了应用生态的独特壁垒。在起售价高达230美元的情况下,消费者不再仅仅因为“便宜”或“亚马逊账号”而购买平板。Alexa+必须提供真正不可替代的价值,才能让用户在苹果iPad或三星Galaxy Tab面前选择亚马逊。
从Fire到Alexa Tablet,亚马逊试图用人工智能重新定义平板的使用体验。但在这个巨头林立的市场中,仅靠语音助手和价格优势,是否足以让亚马逊重新夺回话语权?当围墙被拆除,生态的护城河又该如何重建?这或许是亚马逊面临的最严峻考验。
2026年10月9日
科技巨头苹果正酝酿一场跨越硬件形态与家庭生态的重大变革,其接下来的动作不仅关乎产品迭代,更可能重新定义用户与数字设备的交互方式。根据最新情报,苹果已确认将于10月13日在纽约举办一场以“Welcome home”为主题的智能家居发布会,而紧随其后的10月27日左右,备受瞩目的触屏MacBook Pro和OLED iPad mini也将正式亮相。这一连串密集的产品发布计划,标志着苹果在两个长期被忽视或保守对待的领域同时发力。
首先聚焦于家庭场景。苹果此次智能家居发布会的核心看点,是传闻已久的HomePad中枢设备。这款设备被描述为带有显示屏的家庭控制中心,旨在为Siri AI提供一个专属的“面孔”。据称,HomePad将运行全新的homeOS系统,支持类似iPhone待机模式的界面,并集成面部和语音识别功能。此前,苹果曾将HomePad的开发进度与Siri AI的成熟度挂钩,如今随着AI能力的提升,这款设备终于有望落地。此外,发布会上预计还将推出新款HomePod mini以及更新版的Apple TV,共同构建一个更紧密互联的家庭智能网络。这意味着,Siri不再仅仅是一个隐形的语音助手,而是拥有了可视化的交互界面,能够更直观地处理家庭事务。
与此同时,苹果在个人计算设备上的突破同样令人期待。彭博社报道称,苹果首款配备触摸屏的MacBook Pro即将问世,提供14英寸和16英寸两种尺寸。这一举措打破了苹果长期以来对笔记本电脑引入触摸屏的抵制,被视为其设计哲学的一次重大转折。传闻显示,这些新机型将采用OLED显示屏,并以Dynamic Island(灵动岛)取代现有的刘海设计,从而在保留物理屏幕空间的同时,融入更多的触控交互元素。这种设计不仅提升了屏幕利用率,也为多任务处理和手势操作提供了新的可能性。
在平板领域,iPad mini也将迎来显著升级。新款设备预计将采用OLED屏幕,并搭载A20 Pro芯片,取代现有的A17 Pro。更值得注意的是,其FaceTime摄像头将改为横向布局,以与其他iPad机型保持一致,优化视频通话体验。这一系列硬件升级,配合新的操作系统功能,旨在为用户提供更流畅、更沉浸的使用体验。
这些新品之所以重要,在于它们共同测试了一个核心命题:新的触控和语音功能是否足以简化日常任务,从而让用户愿意为硬件升级买单。触屏Mac的推出,意味着苹果正在重新评估触控技术在生产力工具中的价值,试图在键盘操作与触控交互之间找到新的平衡点。而HomePad的出现,则表明苹果希望将AI助手从手机延伸到家庭生活的每一个角落,让智能家居真正“聪明”起来。
从更宏观的角度看,苹果的这一系列动作反映了其在AI时代下的战略调整。通过赋予Siri专属屏幕,苹果试图解决语音助手在复杂场景下交互效率低下的问题;通过引入触屏Mac,苹果则是在探索后键盘时代的人机交互新范式。这些变化不仅是对现有产品线的补充,更是对未来生活方式的一次预演。当屏幕不再只是显示信息的窗口,而是成为感知和交互的界面时,我们使用的设备将变得更加主动和智能。
然而,技术革新往往伴随着争议。触屏Mac是否会削弱键盘输入的效率?HomePad是否会成为另一个吃灰的智能设备?这些问题仍需市场来回答。但可以确定的是,苹果正在通过这两条战线,试探用户对新技术的接受边界。无论结果如何,这场关于“家”与“工作”的数字化重构,都值得我们密切关注。毕竟,当科技真正融入生活的肌理,它带来的不仅是便利,更是对我们日常习惯的深刻重塑。