VideoRAE:用视频基础模型重塑生成式视频的潜空间
VideoRAE 试图把冻结的视频基础模型表征,转化为既能重建、又适合生成模型使用的视频潜变量。相比传统 3D-VAE,它更强调语义与时空结构,而不只是像素级还原。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 811 篇文章
VideoRAE 试图把冻结的视频基础模型表征,转化为既能重建、又适合生成模型使用的视频潜变量。相比传统 3D-VAE,它更强调语义与时空结构,而不只是像素级还原。
阅读全文一篇新 arXiv 论文提出 MOJO,将掩码自编码式自监督学习与监督解码目标结合,让 spike-tokenizing 神经解码模型能利用大量未标注数据。实验显示,它在标注稀缺和跨会话微调场景中尤其有优势。
阅读全文一篇 arXiv 新论文提出用到标准高斯的平方 Wasserstein 距离衡量非高斯性,并据此构建 OT-ICA 算法。该方法希望替代传统 ICA 中常见的累积量或参数似然代理目标。
阅读全文一篇新论文将“视频生成式游戏引擎”的讨论拉回到传统游戏引擎的基本循环:动作、状态与观察。作者认为,真正可玩的交互世界不仅要生成画面,还要让规则、后果与状态在长时间内保持一致。
阅读全文据 404 Media 报道,黑客取得的 Suno 文件显示,这家 AI 音乐生成公司曾从 YouTube Music、Deezer、Genius 等平台抓取大量音频和歌词。事件让 Suno 训练数据来源、版权抗辩和用户数据安全问题同时暴露在聚光灯下。
阅读全文一篇 ICML 2026 录用论文提出 MetaPerch,探索把地点、时间等录音元数据作为辅助监督信号,用于训练生物声学基础模型。它的核心问题不是“多听更多声音”,而是让模型理解声音背后的生态与地理语境。
阅读全文一篇 arXiv 新论文用冻结的 Evo 2 表征训练轻量探针,评估其在宏基因组数据中识别抗微生物耐药性和细菌毒力信号的能力。结果显示,AMR 信号相对容易被解码,但毒力识别与生成序列标签判定仍存在边界。
阅读全文Ai2 在 Hugging Face Blog 介绍了海事 AI Agent Shippy 的工程架构。它的核心启示是:真正可用的 Agent,关键不在“模型更聪明”,而在工具、权限、评测和边界设计是否可靠。
阅读全文Hugging Face 上 IBM Research 的文章指出,模型路由在企业 Agent 中远比按任务难度分流复杂。真正有效的路由需要同时优化成本、质量、延迟、缓存和治理约束。
阅读全文一篇新论文提出 Hindcast,通过“回到过去”的方式重放已结束的 Polymarket 市场,评估大模型在结果尚不可知时能否做出有效预测。它重点解决了检索和训练数据带来的答案泄漏问题。
阅读全文一篇 arXiv 论文提出 Deep Interaction,让用户在大模型原始回答中直接编辑错误推理步骤,再将修正后的思路提炼成提示,引导模型沿正确路径继续推理。
阅读全文一篇 arXiv 论文提出 Earthquaker-AI,将 Lego WeDo2 机器人模拟、RAG 对话助手与分级量规评价结合,用于小学阶段的地震避险教育。
阅读全文一篇 arXiv 论文提出了面向职业再培训的 AI 加速端到端框架,覆盖知识获取、课程开发、审核、教学与测评五个环节。其亮点不在单点工具,而在把内容生产效率与学习效率放进同一套流程中考量。
阅读全文一篇 arXiv 新论文以满文历史文献为案例,探索用“多专家+页面级路由”解决低资源、多书体 OCR 难题。系统复用微调过程中的检查点作为专家,并由轻量分类器按视觉风格分发页面。
阅读全文一篇 arXiv 论文提出 PAT 系统,尝试把大语言模型从“逐句翻译”推向整篇、语料驱动的语用重写。研究显示,规格约束与可比语料检索确实能促使模型做出更大幅度的篇章 reformulation,但效果仍不稳定。
阅读全文一项针对 2361 个热门 GitHub 仓库的研究显示,智能体编程工具已经开始进入开源协作流程,但真正高强度使用仍集中在少数项目中。
阅读全文一篇 arXiv 新论文聚焦可再生能源预测中的特征选择问题,提出了聚类式顺序特征选择 CSFS。该方法在保持与传统顺序特征选择相近预测表现的同时,平均降低了 21% 计算成本。
阅读全文这篇 arXiv 论文从“秩是否能穿越深层网络”的角度,重新解释 Transformer 前馈块中残差连接、归一化位置和宽度扩展的作用。作者认为,许多看似用于控制数值幅度的设计,本质上也在调节梯度路径中的秩塌缩风险。
阅读全文一篇 arXiv 新论文提出 Lighthouse RL,用训练中发现的高质量电路配置作为重置点,引导强化学习更快探索有希望的设计区域。该方法面向模拟电路尺寸优化,强调样本效率、泛化能力和黑盒优化成本控制。
阅读全文一篇 arXiv 论文提出,AI 赋能系统的渗透测试不能只看服务器、配置或权限是否被攻破,还要评估攻击者能否通过提示、检索内容、传感器输入或工具调用影响系统行为。其核心是把测试目标从资源 compromise 扩展到运营目标被违反。
阅读全文arXiv 新论文提出 M⁴World,一个可生成环视视频与同步 LiDAR 的驾驶世界模型,重点解决可控场景编辑与长时间稳定生成两类问题。其亮点在于支持对象级操控,并能以在线因果方式进行分钟级连续流式生成。
阅读全文