FM²:面向异构多模态医学影像的联邦基础模型框架
FM² 试图解决医学影像基础模型训练中的两难:模型需要跨机构数据,但隐私与合规限制了集中汇聚。论文将重点放在不同医院、不同影像模态之间的结构性异质上,并提出联邦式统一训练方案。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 811 篇文章
FM² 试图解决医学影像基础模型训练中的两难:模型需要跨机构数据,但隐私与合规限制了集中汇聚。论文将重点放在不同医院、不同影像模态之间的结构性异质上,并提出联邦式统一训练方案。
阅读全文一篇被 ACM MM 2026 接收的论文指出,视频 LLM 在基准测试中的高准确率,并不总是等同于真实的视觉理解。作者提出 Visual Dependency Gap(VDG),用原始视频与黑屏输入之间的正确率差异来审计模型是否真正依赖视觉信息。
阅读全文这篇 arXiv 论文提出 GFlowRL,用批内蒙特卡洛估计取代 GFlowNet 训练中的辅助分区函数网络,试图让分布匹配式 RL 更稳定地用于大模型后训练。
阅读全文一篇 arXiv 论文系统分析了 On-Policy Distillation 在大模型后训练中的角色与风险。研究认为,OPD 更像是探索催化剂,其成败取决于教师信号是否可靠。
阅读全文Boogu-Image-0.1 是一个面向图像理解、生成与编辑的开源统一多模态模型家族,包含 Base、Turbo、Edit 和 Edit-Turbo 等版本。论文强调,在有限算力下,通过数据、训练流程和推理时扩展优化,开源模型仍有机会接近闭源系统表现。
阅读全文一篇 arXiv 新论文提出 SPINE,用多智能体流程帮助双臂机器人完成调试与部署,降低对机器人专家的依赖。实验显示,它在两个不同平台上提升了从故障到可遥操作的成功率与效率。
阅读全文一篇 arXiv 论文提出面向 Agentic AI 的原生保险框架,把自主性、权限暴露、治理成熟度等因素纳入承保和定价。它试图回答:当 AI 代理能调用工具、改变外部环境并影响第三方时,风险该如何被量化和约束。
阅读全文这篇 arXiv 论文讨论了一个常被“总 FLOPs”掩盖的问题:在固定后训练预算下,算力究竟该投向更大模型、更多更新、更多 rollout 搜索,还是更强的奖励反馈?作者提出了面向 GRPO 的 FLOP 记账框架,并用 LoRA 适配的 Qwen2.5 策略模型做了条件性对比。
阅读全文一篇 arXiv 论文提出 BitMind Forensics:通过开放式对抗竞赛持续刷新训练分布的深度伪造检测系统。其在 19 个公开数据集上的结果显示,动态检测框架在野外图像、视频与生成式媒体评测中明显优于多种静态开源检测器。
阅读全文一篇 ICML 2026 Spotlight 论文提出“理论级自动形式化”视角:AI 不应只把单个自然语言命题翻译成形式语言,而应构建包含定义、引理、依赖关系的完整形式化知识库。
阅读全文arXiv 新综述《Self-Improvements in Modern Agentic Systems》将自我改进智能体视为可从经验中积累能力的自适应系统。论文重点不在某个单点算法,而在梳理模型、提示、记忆、工具与控制逻辑如何共同被更新。
阅读全文一篇 arXiv 论文提出 Safe-Psych,用顺序式临床信息披露来评估大模型在精神科诊断中的不确定性处理能力。研究显示,强模型并不等于会校准风险,许多模型会在证据不足时过早给出诊断。
阅读全文一篇 arXiv 论文提出 OriginBlame,试图解决模型训练数据删除请求中的“找不到该删哪些样本”问题。它将作者身份沿数据处理流水线传播,并用确定性查询生成更精确的遗忘集。
阅读全文一篇 arXiv 新论文指出,按注意力累计值淘汰 KV Cache 的方法,在嵌套 JSON 等结构密集文本上可能错误保留大量“结构噪声”。作者提出无需重训的角色条件分配策略,用较小额外开销缓解这一问题。
阅读全文一篇 arXiv 新论文系统研究了“人格向量”在开放权重大模型审计中的作用。研究显示,提示词未必能暴露模型真正的行为边界,而激活空间中的行为方向可以帮助识别模型默认表达、可被放大和难以提取的特质。
阅读全文这篇 arXiv 论文提出 Mycelium:一种面向多人科研团队的主动共享工作空间,让 AI 代理不只服务单个用户,而是在团队、工具与实验流程之间路由关键发现与假设。
阅读全文Agora 试图证明,大模型预训练不必完全依赖封闭数据中心。它通过互联网级链路上的流水线并行、容错协同和模型分片,让分散的消费级 GPU 参与 8.6B 参数模型训练。
阅读全文Hugging Face 披露一起生产基础设施入侵事件,称攻击由自主 AI 代理系统端到端执行,并利用数据处理链路中的代码执行路径取得初始立足点。事件凸显 AI 平台的数据与模型表面已成为关键攻击面,防守也需要可控的本地 AI 能力。
阅读全文一项新基准 SDABench 不再只看大模型能否跑通代码或完成分析流程,而是从科学主张所需的能力出发,评估 LLM 在描述、推断、因果与机制解释等任务中的真实短板。
阅读全文据报道,微软正在让销售团队更强调自研AI模型在效率、成本和企业集成上的优势,并将OpenAI、Anthropic等昔日关键伙伴放到对比面上。
阅读全文Mira Murati 创立的 Thinking Machines Lab 推出首个自研开放权重模型 Inkling,试图用可下载、可微调的路线挑战通用闭源大模型。它不宣称性能最强,而是把企业定制、成本效率和不确定性表达放在核心位置。
阅读全文