REBASE:无需训练的一次示例分割,关键在于先“擦掉背景”
REBASE 提出一种训练自由的 in-context segmentation 方法,通过移除参考图像中的背景特征子空间,降低跨图像匹配时的背景干扰。它与 SAM 等可提示分割模型结合,在多个数据集上刷新训练自由方法表现。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
REBASE 提出一种训练自由的 in-context segmentation 方法,通过移除参考图像中的背景特征子空间,降低跨图像匹配时的背景干扰。它与 SAM 等可提示分割模型结合,在多个数据集上刷新训练自由方法表现。
阅读全文Xiaomi-Robotics-1 试图把大模型的“规模化法则”引入机器人学习:用超过 10 万小时真实操作轨迹预训练,再对齐真实机器人和自然语言指令。实验显示,更大的数据和模型规模能带来更低动作预测误差,并提升真实机器人任务成功率。
阅读全文KAIST AI 提出的 Robot-Centric Pointmaps 试图解决 VLA 模型中相机视角与机器人动作坐标系不一致的问题。它把场景点的三维坐标直接编码到机器人坐标系下,同时保留类似图像的二维网格结构,便于接入现有 VLA。
阅读全文RAGU 提出一种更工程化的 GraphRAG 路线:把知识抽取和图谱整合拆开,并用面向 RAG 任务微调的 7B 模型 Meno-Lite-0.1 降低构图成本。
阅读全文这篇论文提出以“成本—成功率”视角重新评估攻防安全智能体,强调推理、工具调用和遥测查询都会带来实际开销。研究显示,红队与蓝队任务的扩展规律并不相同。
阅读全文NAVER AI Lab 提出的 On-Policy Delta Distillation(OPD²)不再直接模仿教师模型完整输出,而是学习推理调优前后产生的能力增量。论文称,这一设计在数学、科学与代码推理任务上稳定优于传统在线策略蒸馏。
阅读全文Qwen 团队发布 Qwen-Music 技术报告,展示了一个面向文本生歌与翻唱生成的音乐模型。其核心亮点是将旋律规划引入自回归音乐建模,并通过渲染模块补足高保真立体声细节。
阅读全文S1-Omni 试图用一个统一多模态模型连接 AI4Science 中长期分散的任务与数据形态。它覆盖 200 多个科学任务,并开放了模型权重、推理代码和部分数据集。
阅读全文这篇论文把 Muon 从大规模预训练场景拉到稀疏奖励的智能体强化学习后训练中,发现它并非“换上就有效”,而是在特定优势估计方法和学习率设置下显著优于 AdamW。
阅读全文一篇新论文指出,即便谈判中的具体数值被加密,智能体的让步节奏、出价轨迹和收敛模式仍可能暴露私有约束。研究提出一种自适应随机谈判策略,在保护行为隐私的同时尽量维持成交率与效用。
阅读全文NVIDIA 在 Hugging Face 上发布 Cosmos 3 Edge,一个面向机器人与视觉 AI 的 4B 参数开放世界模型。它试图在边缘设备上同时承担场景理解、未来预测与动作生成任务。
阅读全文Grab 为自治型 AI 工作负载构建了 Palana 平台,用 Kubernetes、零信任隔离、代理鉴权和审计机制,为不可预测的智能体行为设置可控边界。
阅读全文xHC 试图把 Hyper-Connections 从常见的 N=4 推向更大规模,让残差流宽度成为大模型预训练中的可用扩展轴。论文显示,它在 18B 和 28B MoE 模型上相较 mHC 带来稳定收益,同时控制了额外训练成本。
阅读全文Hugging Face Daily Papers 收录的论文介绍了 Loopie,一个以循环计算提升 Transformer 表达能力的 MoE 模型系列。作者称,在相同预训练计算预算下,Loopie 超过了常规 Transformer 基线,并在后训练后展现出强推理能力。
阅读全文Cura 1T 不是把通用大模型简单“加一点医疗语料”,而是围绕医疗场景的多项能力做分阶段自我进化。它试图同时覆盖问诊、临床推理、图文诊断和 EHR 工具使用。
阅读全文NVIDIA 推出的 AV-Flamingo 面向长而复杂的真实世界音视频场景,不再只盯着短片段,而是强调跨模态、跨时间的联合推理。它通过大规模数据、分阶段训练和带时间戳的链式思考,在多项基准上表现出很强竞争力。
阅读全文Sakana AI 等研究者提出 Recursive Harness Self-Improvement(RHI),把智能体运行框架视为可迭代优化的提示级规范。论文显示,少量迭代就能改善低推理强度智能体的表现,并降低推理成本。
阅读全文DSWorld 将世界模型思想引入自治数据科学智能体,通过预测操作后的状态变化,减少昂贵的试错执行。论文称,该框架可将强化学习训练加速约 14 倍,并将搜索式推理加速约 3 至 6 倍。
阅读全文Kimi 因用户请求量快速增长、现有算力集群接近承载上限,宣布暂停 C 端新用户订阅,并同步推进算力扩容。此次调整还涉及订阅权益拆分,Kimi 主权益与 Kimi Code 权益将分别管理。
阅读全文