返回文章列表
AI 科研

RIBOSPAN:把长上下文能力带入全长 RNA 建模

阅读约 3 分钟

导语

RNA 基础模型正在从“理解局部序列”走向“处理完整转录本”。这一步并不只是把输入窗口拉长:许多信使 RNA 的长度已经超过既有模型的预训练上下文,模型若只能看到片段,就可能难以同时利用编码区、非编码区以及远距离调控信息。论文提出的 RIBOSPAN,针对这一限制从预训练阶段重新设计长上下文能力。

核心要点

  • 原生支持长序列。 RIBOSPAN 拥有 16.1 亿参数,采用双向架构,并在最长 10,240 个核苷酸的上下文上进行预训练,而不是先训练短窗口、再在推理阶段强行外推。
  • 保留单核苷酸分辨率。 模型以单个核苷酸作为基本 token,结合密集双向自注意力,目标是在处理完整 RNA 的同时保留精细的局部信息。
  • 通过序列打包控制干扰。 研究采用 attention-isolated sequence packing,让被打包的不同序列在注意力计算中彼此隔离,从而提升训练效率,同时避免无关序列污染表示。
  • 长上下文能力需要专门评估。 在核苷酸重建、受控长上下文表示基准和冻结表示评测中,原生 10K 模型在长序列上保持了较好的恢复能力、上下文响应和 RNA 类型区分能力。继续预训练并提高到 40% 掩码率后,模型在重度破坏输入下的恢复能力进一步增强,同时表示质量没有明显牺牲。
  • 外推并不等于原生长上下文。 对短上下文模型使用 YaRN 等推理时扩展方法,可以找回部分上下文组织能力,但会带来更明显的远距离表示扩散。相比之下,原生长上下文训练更有利于把扰动影响限制在局部区域。
  • 从表示学习延伸到设计。 研究者基于同一骨干网络构建多维条件离散扩散框架,用于全长 mRNA 生成与重设计,并探索在保持蛋白质序列不变的前提下进行同义密码子扩散优化。

意义与影响

RIBOSPAN 的价值不只在于上下文数字更大,而在于它把“完整转录本”作为模型设计的基本对象。对于需要同时观察长编码区和非编码区的任务,原生长上下文可能比简单扩大推理窗口更可靠。论文中的表示评测也提示,长上下文模型不仅要能读进更多序列,还要避免一个位置的变化在表示空间中无边界地扩散。

当然,10,240 个核苷酸并不意味着模型已经解决所有 RNA 设计问题。论文材料主要展示了重建、表示质量以及生成和重设计框架的能力,真实生物功能仍需要实验验证。总体而言,RIBOSPAN 为全长 RNA 表示学习和 mRNA 设计提供了一条更完整的技术路线:先在预训练阶段建立长距离建模能力,再将其迁移到生成、优化和下游生物信息学任务中。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章