EZ.AI Daily
每日 AI 新闻与论文精选
生物AI幻觉:模型其实没看基因序列
正在播放 1/10
0:000:00
2026年10月3日
在人工智能与生物学深度融合的今天,生物推理模型(Biological Reasoning Models)被视为连接大型语言模型(LLM)与生物基础模型(如DNA、蛋白质表示)的关键桥梁。业界普遍假设,这些模型在基准测试中的高准确率,证明了LLM确实能够基于生物输入进行逻辑推理。然而,一项针对六个主流生物推理模型的最新研究,对这一核心假设发起了强有力的挑战。研究团队深入剖析了涵盖DNA、蛋白质和单细胞任务的模型表现,通过一系列严谨的实验设计,揭示了当前生物AI背后令人担忧的真相。
研究团队首先采用了一种“扰动测试”方法。他们在保持查询语句和其他输入不变的情况下,专门对生物输入进行干扰。例如,在DNA任务中,他们打乱了基因序列,观察模型预测疾病准确度的变化。结果令人震惊:对于BioReason和BioReason-Pro这两个模型,打乱DNA序列几乎未对其疾病预测准确率产生任何影响。这意味着,模型在做出判断时,可能根本“无视”了核心的生物数据。
为了进一步验证这一点,研究人员构建了“证据冲突”场景。他们将一个基因组、蛋白质或细胞的生物基础模型表示,与另一个不同实体的文本描述强行配对。在这种矛盾情境下,模型究竟会听从生物数据,还是盲从文本描述?数据显示,Evo2和ESM3这两个基础模型在BioReason和BioReason-Pro中的贡献微乎其微。在证据冲突测试中,这两个模型分别有97.9%和99.7%的情况完全跟随文本描述,而忽略了生物输入。这直接表明,模型所谓的“推理”很大程度上依赖于语言模式的匹配,而非对生物信息的真正理解。
有趣的是,线性探针(Linear Probes)的分析显示,Evo2和ESM3的表示中确实编码了与任务目标相关的信息。也就是说,生物数据本身是有用的,但问题在于当前的后训练策略未能让LLM有效地利用这些信息。相比之下,其他模型如ChatNT、Prot2Text-V2和CellWhisperer则表现出不同的特征,其基础模型输入对性能有显著贡献。而在Cell2Sentence-Scale中,基因句子中的差异表达基因也对性能起到了积极作用。这说明不同架构和训练策略下,生物输入的利用率存在巨大差异。
研究还深入分析了推理轨迹(Reasoning Traces)。在BioReason中,模型经常错误陈述核苷酸变化;而在BioReason-Pro中,当出现证据冲突时,其推理轨迹描述了最终预测中被省略的功能。更令人深思的是,在BioReason-Pro的SFT(监督微调)和RL(强化学习)检查点,以及42个BioReason检查点中,准确率的提升并不伴随着生物输入贡献度的增加。换句话说,模型变得更“聪明”了,但它并没有变得更“懂生物”。
这项研究揭示了一个严峻的现实:当前的后训练策略并不能确保基础模型表示对任务性能产生实质性贡献。生物AI的高分可能只是语言模型强大泛化能力的体现,而非生物推理能力的证明。当我们在医疗诊断或药物研发中依赖这些模型时,必须警惕其可能存在的“生物幻觉”。真正的生物推理,不应仅仅依赖于文本与生物数据的表面关联,而应建立在模型对生物机制深层理解的基石之上。如何打破这种“文本依赖”,让AI真正读懂生命的代码,将是未来生物人工智能领域亟待解决的核心难题。
2026年10月3日
在流式视频大语言模型(LLM)的领域里,一个核心难题始终困扰着研究者:模型必须在不知道未来任务需求的情况下保留证据,并在证据充分时做出响应。如何在形成可复用的事实记忆的同时,不损害实时感知能力,是这一领域的关键挑战。OneStreamer应运而生,它通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,为这一难题提供了创新的解决方案。
OneStreamer的核心在于其主动层级字幕记忆(Proactive Hierarchical Caption Memory,简称PHCM)。这一机制能够生成基于时间的局部细节字幕和已完成事件的摘要。在训练阶段,流式字幕目标监督模型对观察到的视频前缀进行解读。而在推理阶段,模型生成的记录与最近的视觉窗口相结合,提供了可复用的事实上下文,无需重新访问历史视觉特征。这种设计使得模型能够在不牺牲实时性的前提下,高效地利用历史信息。
此外,OneStreamer引入了主动状态转换学习(Proactive State Transition Learning,简称PSTL)。这一方法通过在所有输出锚点保留监督,并选择代表性的状态变化和状态持续令牌,减少了重复等待状态的主导地位。PSTL不仅提高了模型的效率,还确保了在监督仅27.5%的标注状态令牌的情况下,性能优于密集状态监督。
为了支持这一研究,团队开发了一个流式数据合成管道,将输出内容和时间与可用证据对齐。结合生成的流式字幕和问答,以及清理后的开源数据,形成了OneStreamer-1M数据集。这个数据集包含超过一百万条记录,涵盖了多种任务,为流式视频交互研究提供了广泛的数据支持。
在性能方面,OneStreamer的4B模型在所有八个评估的流式视频理解基准测试中均取得了最佳结果。消融实验表明,保留生成的字幕能够改善历史问答,同时不降低实时感知能力。PSTL在仅监督27.5%的标注状态令牌的情况下,性能也优于密集状态监督。这些结果共同支持了主动生成作为连接感知、记忆形成和及时响应的共享学习接口在流式视频交互中的有效性。
OneStreamer的研究不仅展示了流式视频交互的新方向,也为未来AI在实时视频处理中的应用提供了重要的技术基础。如何在保持实时性的同时,高效地管理和利用历史信息,将是未来研究的重要课题。
2026年10月3日
在具身智能的探索之旅中,研究者始终面临一个核心困境:如何让机器既懂“世界”,又能“行动”。现有的视觉-语言-动作模型(VLA)虽然继承了预训练视觉-语言模型强大的理解与推理能力,但仅靠动作监督,使其对世界动态的感知显得苍白无力。另一方面,世界-动作模型(WAM)虽然能从视频生成模型中继承时空先验知识,却在面对分布偏移时,缺乏足够的语义理解和推理能力。为了解决这一矛盾,研究团队推出了UniWAM,一个统一的世界-动作模型架构。
UniWAM的核心创新在于其“三位一体”的设计。它不再将物理推理、世界生成和动作预测视为孤立的任务,而是通过一个统一的架构将它们深度融合。这意味着模型能够同时学习对物理世界的语义理解、视觉生成以及动作预测。这种联合学习机制,让模型在理解“发生了什么”的同时,也能精准预测“接下来该怎么做”,从而在语义层面和物理层面实现了双重 grounding。
然而,强大的架构需要高质量的数据来喂养。为了确保训练数据的纯净与准确,研究团队开发了一套严谨的数据清洗和标注流程,专门针对人类第一人称视角数据和机器人数据进行了精细化处理。这一步骤为后续模型的稳健性奠定了坚实基础。
在训练策略上,UniWAM展现了极高的巧思。为了将视觉-语言组件适配到具身任务中,同时保留其继承的语言能力,研究者提出了一种新颖的方法:将低层动作表示为自然语言。通过引入一种预训练配方,模型能够从视觉问答(VQA)数据、人类第一人称数据和机器人演示数据中获得互补的监督信号,并将这些信号分配给模型中相应的组件。这种分工协作的训练方式,让模型在保持语言理解优势的同时,学会了如何执行具体的物理动作。
在后训练阶段,UniWAM进一步提升了效率。通过引入未来视觉噪声增强技术,模型减少了对精确未来预测的依赖,从而增强了鲁棒性。同时,采用基于历史条件的流匹配方法,利用编码后的动作历史来初始化动作生成。这些设计不仅显著减少了去噪步骤,还维持了高性能表现,使得推理过程更加高效。
实验结果令人振奋。UniWAM在多项评估中均达到了最先进(SOTA)的性能水平,涵盖了分布内性能、鲁棒性、泛化能力、指令遵循以及长时程任务执行等多个维度。更引人注目的是,研究团队发现了一个对统一人机协同训练的对数线性缩放定律。这一发现证明了在混合人类和机器人数据上进行大规模预训练的有效性,揭示了数据规模与模型性能之间清晰的规律性关系。
UniWAM的出现,标志着具身智能研究从“单一能力优化”向“统一架构协同”的重要跨越。它证明了,当语义理解、世界模拟和动作执行在同一个模型中深度融合时,智能体不仅能更深刻地理解物理世界,还能更灵活、更鲁棒地与之交互。这一突破不仅提升了当前机器人的任务执行能力,更为未来构建真正具备通用世界模型和自主行动能力的智能体指明了方向。在数据与算法的双重驱动下,人机协同训练的红利正在显现,而统一架构或许正是通往通用具身智能的关键钥匙。
2026年10月2日
在后训练领域,为前沿模型引入新能力一直是核心目标。传统观点认为,监督微调(SFT)虽然能利用离线专家数据,但往往泛化能力弱且易发生灾难性遗忘;而强化学习(RL)虽能实现强泛化并保留现有能力,却依赖模型通过重复采样自行探索成功轨迹,难以直接利用高质量的离线数据。本研究旨在结合两者优势,既利用离线数据中的特权信息,又保持在线策略学习的优势。研究团队并未修改学习目标,而是创新性地调整了数据分布,使其更契合学习者。他们引入了一种马尔可夫链蒙特卡洛(MCMC)采样算法,该算法基于参考微调模型,逐步将离线轨迹转化为更接近在线策略的数据。在科学技能获取、数学推理及开放式专业知识等任务中,这种采样算法使SFT的表现媲美主流后训练技术,甚至在泛化能力和遗忘抑制方面优于强大的在线策略基线。此外,微调后的模型展现出强大的分布性能,能够超越基础模型分布的锐化,学习更广泛的内容。从更宏观的角度看,该方法将采样视为一种模型原生算子,用于塑造数据以提升可学习性,为后训练栈提供了通用的基础原语。这一发现挑战了SFT泛化能力弱的固有认知,揭示了通过数据分布调整而非单纯依赖算法目标修改,同样能实现高效且稳健的后训练效果。
2026年10月2日
在医学工程领域,一个长期困扰研究者的难题是如何让植入体内的设备彼此“对话”。传统的蓝牙技术在此处显得力不从心,它不仅耗电巨大,还需要体积庞大的天线,这在狭小的体内空间中几乎无法实现。然而,乔治亚理工学院的工程师们提出了一种颠覆性的解决方案:SWANS系统。这项技术不再依赖无线电波,而是巧妙地将人体组织本身转化为通信网络,让植入体像通过电线一样直接传递电信号。
SWANS的核心逻辑在于利用生物组织的导电性。系统由一个中心枢纽发出特定的电脉冲,而每个植入体都经过校准,只识别属于自己特定强度和长度的脉冲信号。这种机制极大地降低了功耗,使得植入体几乎无需额外电池即可运行。在实验室测试中,研究人员展示了令人惊叹的结果:在猪腹部的组织中,一个电脉冲成功传播了超过30厘米,这一距离是蓝牙技术在该环境下有效范围的10倍。更令人兴奋的是,在活体大鼠实验中,前爪上的传感器成功触发了后腿植入体的反应,模拟了行走时的神经信号传递,证明了这种跨部位协同工作的可行性。
尽管前景广阔,但这项技术仍处于早期阶段。目前的系统仅能传输简单信号,且需要针对每个个体的身体特征进行精细调整。此外,研究尚未在大型动物或人体上进行测试,距离临床应用还有相当的距离。然而,如果未来能在人体中验证成功,这种基于身体组织的网络将彻底改变医疗模式。想象一下,当某个部位的传感器检测到异常时,可以立即触发另一部位的药物释放或神经刺激,实现精准且及时的联合治疗。对于那些对给药时机要求极高的疾病,这种“感知-治疗”一体化的闭环系统可能带来革命性的突破。虽然目前我们仍处在老鼠实验的起步阶段,但SWANS系统已为我们描绘了一幅未来图景:我们的身体不再只是被动的容器,而将成为主动协调、自我管理的智能网络。
2026年10月2日
在当前的视频世界模型领域,一个长期存在的痛点困扰着研究者:模型往往以“演员”(即智能体)为中心,一旦物体离开智能体的视野,模型便失去了对其演化的直接证据。这导致当物体重新进入视野时,其状态和动态往往无法得到准确保留,仿佛时间在那一刻停滞了。为了解决这一“视野盲区”难题,研究团队提出了名为 World Observer 的新框架,旨在让世界模型能够持续观察演员当前视野之外的区域。
World Observer 的核心创新在于将“观察”与“行动”解耦。它不再仅仅依赖单一的智能体视角,而是联合生成一个负责智能体中心视角的“演员”,以及一个或多个全景“观察者”。这些观察者被部署在场景中的特定位置,专门监视选定的世界区域。这种机制允许那些离开演员视野的物体在观察者中保持视觉上的持续演化,从而确保当它们重新进入演员视野时,其更新后的状态能够被准确反映。
为了在几何上锚定演员和观察者,World Observer 采用了一种从共享全景源进行变形的技术,建立了明确的几何对应关系。此外,针对物体重新进入视野时细节丢失的问题,研究团队引入了“观察者汇”(Observer Sink),利用高分辨率的透视参考来恢复精细的外观细节。由于观察者与演员是解耦的,它们可以灵活地放置在场景的任何位置,甚至扩展到多个地点以提供更广泛的覆盖范围,并可通过控制信号来引导视野外的演化过程。
为了科学地评估这种视野外演化能力,研究团队进一步引入了世界空间度量标准,并构建了一个涵盖真实和合成场景的基准测试。实验结果显示,World Observer 在视野外动态表现上有了显著提升,同时在视觉保真度、相机控制和三维一致性方面保持了竞争力。这一突破不仅解决了物体状态丢失的问题,更为构建能够持续感知和演化复杂环境的持久世界模型提供了新的技术路径。当视野不再是认知的边界,我们或许能更真实地模拟那个不断流动、永不停歇的世界。
2026年10月2日
在多模态人工智能的探索旅程中,研究者发现了一个关键瓶颈:模型往往缺乏在复杂交互环境中保持长期视觉记忆的能力。为了解决这一问题,研究团队推出了名为VISTA的视觉框架。这一创新设计旨在赋予通用多模态模型“长时程视觉”能力,使其能够像人类一样直接感知环境,并维持一种无损的视觉记忆。这意味着模型可以保留过去观察到的原始视觉信息,并在推理过程中主动检索和重组这些视觉输入,从而在动态变化的世界中做出更精准的判断。
VISTA的核心优势在于其简洁而强大的设计。它不仅仅是一个简单的工具,更像是一个通用的视觉支架,能够自然地扩展到各种视觉环境中,且只需极少的适配工作。这种通用性使得VISTA在多个基准测试中展现了卓越的性能。特别是在极具挑战性的ARC-AGI-3基准测试中,VISTA展现了惊人的突破。当结合Claude Opus 5.0模型使用时,VISTA将相对人类行动效率分数从40.68大幅提升至完美的100.00。更令人瞩目的是,模型在仅使用比首次参与的人类参与者少57.4%的动作次数下,成功完成了所有25个公开游戏。这一结果不仅证明了模型在逻辑推理上的强大能力,更展示了其在行动效率上超越人类水平的潜力。
除了ARC-AGI-3,研究团队还在另外三个涵盖多样化视觉游戏和谜题的基准测试中验证了VISTA的效果。结果显示,在底层模型相同的情况下,使用VISTA框架的模型显著优于使用最小化框架的基线模型。这表明,限制多模态模型在交互世界中表现的,往往不是模型本身的推理能力,而是缺乏一个合适的“支架”来解锁其潜力。VISTA通过提供无损的视觉记忆和灵活的视觉输入重组机制,成功填补了这一空白。
这一发现对于人工智能领域具有深远意义。它提示我们,未来的智能体发展可能不再仅仅依赖于模型参数的无限扩张,更在于如何构建更有效的交互接口和记忆机制。VISTA作为一个通用的视觉框架,为多模态智能体在复杂视觉环境中的进步提供了新的路径。当机器能够像人一样“看见”并“记住”过去的每一帧画面,并在此基础上进行高效的推理与行动时,人机交互的边界将被重新定义。这不仅是一次技术的突破,更是对智能本质的深刻洞察:真正的智能,源于对世界持续而清晰的感知与理解。
2026年10月2日
在人工智能模型追求极致效率的当下,循环Transformer(Looped Transformers)凭借其通过重复执行共享模块来实现参数高效性的独特架构,成为研究热点。然而,这种架构长期存在一个被忽视的“浪费”:每一次循环迭代都会产生一个可解码的中间状态,但标准解码过程往往只关注最终结果,直接丢弃了这些蕴含丰富信息的早期状态。这种被忽略的中间态,实际上隐藏着巨大的潜力。
为了解决这一痛点,研究人员提出了名为LoopCD(Loop Contrastive Decoding)的新框架。这一创新的核心洞察在于:循环机制天然地提供了“弱-强”预测对。早期的循环迭代由于计算量较少,其预测结果相对较弱;而最终的迭代则代表了更强的预测能力。LoopCD巧妙地利用这一特性,无需任何辅助模型或额外的外部训练,仅通过对比最终预测与早期循环路径的结果,就能引导更精准的Token选择。这种“免费”的对比解码策略,将原本被丢弃的中间状态转化为有效的指导信号。
LoopCD具体分为两种实现方式,以适应不同的计算场景。一种是LoopCD-Logits,它在Logit空间进行操作,仅需额外一次输出路径即可实现;另一种是LoopCD-Hidden,它在隐藏状态空间工作,实现了零输出开销。这种灵活性使得LoopCD能够无缝集成到现有的循环Transformer架构中。
实验数据有力地证明了LoopCD的有效性。在涵盖四个循环Transformer家族的广泛测试中,该方法在保持完整递归深度的同时,带来了显著且一致的性能提升。例如,在数学推理基准测试AIME 2024中,LoopCD-Logits将Ouro-2.6B-Thinking模型的pass@1准确率从61.88%大幅提升至73.33%。在代码生成任务HumanEval中,LoopCD-Hidden更是将Huginn模型的pass@1从22.56%提升至31.71%。这些数字背后,是模型推理质量的实质性飞跃。
更令人振奋的是,LoopCD不仅提升了质量,还大幅降低了计算成本。由于性能增益显著,研究人员发现即使将递归循环次数减半,LoopCD引导下的模型表现依然能够匹配甚至超越全深度且无引导的基线模型。这意味着,通过减少循环次数,前向传播的浮点运算量(FLOPs)降低了22.5%至48.2%。这一发现对于降低大模型推理成本具有极高的实用价值。
LoopCD的出现,标志着我们开始重新审视循环架构中每一个中间步骤的价值。它不再仅仅是一个重复计算的流程,而是一个蕴含丰富梯度信息的资源库。通过挖掘这些被忽视的中间态,我们不仅获得了更智能的解码结果,还实现了计算效率的显著提升。这或许预示着,未来的模型优化不再仅仅依赖于更大的参数规模,更在于如何更智慧地利用现有的计算结构。在效率与效果之间,LoopCD找到了一条近乎完美的平衡之路,为循环Transformer的实际应用打开了新的想象空间。
2026年10月2日
在机器人领域,构建可靠且多样化的操作能力一直面临着巨大挑战。传统方法往往需要耗费大量人力来开发和维护技能、设计奖励机制,并艰难地整合感知与控制。为了解决这一痛点,研究人员提出了名为“重构、练习、实战”(Reconstruct, Practice, Go Real,简称RPG)的新框架。这一框架的核心突破在于,它能够在不更新模型权重的前提下,实现机器人执行系统的自主改进,从而大幅降低了对人工干预的依赖。
RPG的工作流程充满智慧。首先,它从离线数据集中识别出关键的操控能力,并在模拟环境中构建相关的练习任务。在“练习”阶段,RPG利用执行反馈、特权模拟器状态以及可用的数据集视频来深入诊断失败原因。基于这些诊断,系统会开发出新的可复用符号技能,优化现有技能,并据此修订系统提示词。为了确保改进的有效性,RPG引入了跨任务评估机制,在保留任何候选变更或合并修订之前,先对它们进行严格的测试。在测试阶段,多模态大语言模型利用生成的系统提示词和技能库,协调感知与机器人控制,从而执行任务。
实验数据令人振奋。在22个操作任务的保留初始化测试中,RPG展现了惊人的自我进化能力。经过第一轮练习后,任务成功率仅为28.6%,但随着练习轮次的增加,性能显著提升。到了第15轮练习后,成功率飙升至95.0%。这一成绩不仅远超所有评估的基线模型,也大幅领先于ASPIRE(75.5%)以及由GPT-6 Astra Pro驱动的CaP-Agent0(60.0%)。
更令人印象深刻的是其从虚拟到现实的迁移能力。在经过通用的校准和硬件适配程序后,这套冻结的系统在物理世界中表现出色。在三个任务上各进行了十次共30次物理试验,RPG全部成功。这意味着机器人不仅在模拟环境中学会了如何思考,更在真实世界中证明了其行动的可靠性。
RPG框架的出现,标志着机器人学习从依赖人工调参向自主迭代进化的重要一步。它证明了通过模拟练习和反馈诊断,机器人可以像人类一样通过“熟能生巧”来掌握复杂技能。这种无需更新权重即可提升性能的方法,为构建更通用、更高效的机器人系统提供了全新的路径。当机器能够自主从失败中学习并优化自身策略时,我们距离真正智能的通用机器人又近了一步。
2026年10月2日
在大型语言模型(LLM)的强化学习后训练领域,一直存在一种主流假设:后训练过程仅仅是“锐化”了基座模型已有的行为。这种观点认为,虽然后训练能显著提升单次尝试的准确率(pass@1),但往往以牺牲解决方案的覆盖范围(pass@K)为代价。这一权衡在数学和编程任务中已被广泛观察到,但研究者提出疑问:这种规律是否也适用于需要多轮工具使用和交互的智能体(Agentic)任务?毕竟,智能体任务可能需要模型在后训练期间习得全新的能力,而不仅仅是强化旧有模式。
研究团队带来了一个令人惊讶的发现:配备轻量级推理框架的预训练基座模型,竟然可以成为强大的智能体。尽管它们在单次准确率上远低于经过后训练的模型,但在给予足够的测试时预算(test-time budget)的情况下,它们在解决方案覆盖范围上往往能超越其经过后训练的对应版本。这一发现挑战了“后训练必然带来全面优势”的传统认知,揭示了一个被忽视的维度:测试时的可扩展性。
为了深入剖析这一现象背后的机制,研究指出后训练实际上将任务推向了两个极端:要么总是能解决,要么永远无法解决。这种极化效应虽然提高了采样效率和一致性,却以牺牲多样性为代价。为了量化这种代价,研究团队提出了一个名为“锐化税”(Sharpening Tax)的诊断指标。该指标专门用于衡量后训练后测试时可扩展性的损失。通过对来自四个模型家族、共14对基座/后训练模型在三个智能体基准测试(共计42个案例)中的表现进行分析,研究发现这种“税”在大多数设置中普遍存在。更重要的是,这种损失可以通过少量的滚动测试(rollouts)进行估算,并且与其他指标具有良好的相关性,这为评估模型能力提供了新的视角。
面对这一挑战,研究团队并未止步于诊断问题,而是提出了一种名为“后验温度调节组采样”(Posterior-Tempered Group Sampling, PTGS)的解决方案。这是一种简单且即插即用的贝叶斯采样器,其核心思想是根据估计的任务难度,针对每个提示词动态调整采样温度。在两个智能体环境中的强化学习训练应用显示,与固定温度的基线方法相比,PTGS支付的“锐化税”更小。这意味着,在重复采样的情况下,它不仅能解决更多的任务,还能同时提升单次尝试的准确率。
这项研究不仅揭示了后训练过程中隐藏的能力损失,更提供了一套实用的工具来平衡效率与多样性。它提醒我们,在追求模型单次表现极致化的同时,不应忽视其在复杂交互场景中通过多次尝试探索解空间的能力。真正的智能,或许不仅在于一次做对,更在于在不确定性中持续探索并最终找到出路的可能性。