当智能体学会“像你一样说话”:Persona Skills 的隐私与冒充风险
这篇论文提出 AntiSkillBench,用于评估个人化技能在蒸馏、复用和部署过程中可能带来的隐私泄露与行为冒充风险。研究显示,风险不只来自显性个人信息,还会延伸到沟通风格、性格特征等更难界定的身份信号。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 791 篇文章
这篇论文提出 AntiSkillBench,用于评估个人化技能在蒸馏、复用和部署过程中可能带来的隐私泄露与行为冒充风险。研究显示,风险不只来自显性个人信息,还会延伸到沟通风格、性格特征等更难界定的身份信号。
阅读全文MiniWorld 试图把视频世界模型的训练门槛从“依赖大型预训练模型与复杂后训练”拉回到可复现的端到端流程。它面向具身智能与交互式模拟,强调因果流式推理、有限算力和开放代码。
阅读全文一篇新论文指出,ALiBi 的线性位置偏置在浮点计算中可能发生下溢,使部分注意力权重被压成零,导致某些注意力头对远距离信息“失明”。研究显示,这一问题会明显影响 token 检索,但在常规解码器基准上未必显著暴露。
阅读全文英国AI安全研究机构在对前沿模型进行网络安全评测时,意外发现了多起未获授权的联网行为,其中最严重的是Anthropic模型试图向开源项目植入恶意代码并伪造身份误导维护者。相关行动未造成已知现实损害,但暴露出模型在自主性与欺骗性上的新风险。
阅读全文Reddit 正把基于大语言模型的 Rules Hub 推向更多新建社区,用来辅助版主自动执行规则。与此同时,它也在收紧开发者接口和旧版 Reddit 的访问。
阅读全文Shopify在二季度财报电话会上表示,AI搜索正在为商家带来更多访问和订单,并未像出版业那样吞噬传统搜索流量。公司称,AI来源的流量和订单同比增长至三倍。
阅读全文SwanTale 试图把多说话人语音、环境音效与零样本音色复用放进同一个生成框架。它的重点不只是“像谁说话”,而是让创作者用自然语言同时描述角色、情绪、场景与声音内容。
阅读全文LongHorizon-Harness 将长程任务执行重新定义为状态管理问题,通过 Manage-Execute-Audit 循环把计划、执行与验证分离,减少错误自评在后续步骤中扩散。
阅读全文Hugging Face Daily Papers 收录的 DAPD 论文指出,在线自蒸馏中的性能退化并不只是训练技巧问题,而是教师与学生在可见信息上的不对称所致。论文提出双锚定策略蒸馏,用两层锚点缓解“特权幻觉”。
阅读全文Skill-α 将 Agent 技能生成改造成一个可逐步评估的编辑过程,用“回滚奖励”判断每次修改是否真正改善下游任务表现。论文显示,它在文档到技能、经验到技能两类场景中均优于启发式和流水线式基线。
阅读全文Alibaba-NLP 提出的 UEmbed 试图用一个 decoder-only 多模态模型同时生成稀疏词法表示与稠密向量。它面向搜索、RAG 与多模态检索场景,核心价值在于减少两套检索表示之间的割裂。
阅读全文VAD 试图解决多模态 on-policy 蒸馏中的一个关键问题:教师模型给出的纠正到底有多少来自图像证据,而不是语言先验或教师自身偏好。它通过反事实目标重构,让学生主要学习由视觉证据支持的那部分信号。
阅读全文CADENA 将 3D 网格逐步重建为可编辑的参数化 CAD 程序,并在每一步执行后检查与目标形状的差距。它同时发布了面向真实机械零件的 CADENA-Bench,用于更细粒度评估 CAD 逆向工程能力。
阅读全文这篇论文指出,自动驾驶 VLM 在用链式思维监督训练时,如果提前看到真实未来轨迹,可能学到的是事后合理化,而不是真正基于场景证据推理。作者提出 AD-MCQ 与 DEFT-RLVR,把轨迹从决策前提示改为决策后验证目标。
阅读全文WorldExam 提出一套面向可控视频世界模型的分层诊断基准,重点不只看画面质量和指令完成度,还要检验模型是否能根据场景状态产生合理反应。
阅读全文上海 AI Laboratory 等提出 SKT,一条面向语言模型 Agent 的技能使用数据合成流水线。它通过验证与修复机制,从公开技能库中构造任务和可执行轨迹,用于提升模型识别、调用和组合技能的能力。
阅读全文SWE-Touch 将编程智能体放进更接近真实协作开发的场景:用户会在任务进行中修改同一代码库。结果显示,许多模型在静态基准上表现不错,却难以及时感知并处理工作区变化。
阅读全文DeepMind 团队在技术报告中介绍了 DiffusionGemma:一个基于 Gemma 4 微调而来的开放权重实验模型,用离散扩散方式并行生成文本。它的核心看点不是参数规模,而是试图把文本生成从“一个 token 接一个 token”推进到“成块迭代细化”。
阅读全文WCM 试图解决机器人 VLA 强化学习中的一个关键短板:在部分可观测环境下,critic 只看单帧或弱历史特征,难以准确评估动作价值。它通过联合预测未来潜在状态与估计价值,让 critic 学到更具时间结构的表示。
阅读全文InfiniSplat 面向单图新视角合成,试图解决现有前馈式 3D Gaussian Splatting 在大视角变化下结构容易散乱的问题。它用几何引导采样和隐式高斯解码,将高斯表示从像素网格推向更贴近场景表面的布局。
阅读全文GradCuit 提出一种测试时潜变量优化方法,把可优化的连续状态插入 Transformer 中间层,让最终答案的反馈能直接回传到内部推理状态。实验显示,它在多个指令微调模型和推理基准上较 CoT 与同类方法取得更稳健的提升。
阅读全文