GPU 不只是硬件:算力期货正在改写 AI 基础设施的定价方式
当 GPU 从稀缺设备变成可按小时租赁的生产资料,算力价格波动就开始具备金融对冲需求。CME、Silicon Data 与 CFTC 的一系列动作,显示 GPU 期货正在从概念走向市场基础设施。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 791 篇文章
当 GPU 从稀缺设备变成可按小时租赁的生产资料,算力价格波动就开始具备金融对冲需求。CME、Silicon Data 与 CFTC 的一系列动作,显示 GPU 期货正在从概念走向市场基础设施。
阅读全文Pew Research对近五年英文网页的分析显示,在剔除ChatGPT发布前的旧页面后,约35%的页面呈现出明显的AI创作或深度编辑迹象。研究也发现,不同类型域名之间的AI使用比例差异显著。
阅读全文企业支出管理平台Ramp推出AI模型路由服务Router,通过统一API连接多家大模型,并提供按成本、性能和难度分配请求的策略。该服务目前仅在美国开放,2026年剩余时间免收路由服务费,但模型推理费用仍由用户承担。
阅读全文Meta 正把实验性 AI 游戏创作应用 Pocket 推向美国用户。用户只需输入提示词,就能生成可互动的小型游戏,并将其发布、 remix 或分享给他人。
阅读全文研究人员发现,攻击者可将恶意提示加密后藏在网页中,诱导Grok自行解密并执行,从而把用户姓名、位置和聊天记录发送至攻击者服务器。该案例暴露出传统静态内容过滤难以覆盖工具输出与运行时状态。
阅读全文Slack正在推出Slack Code,将代码任务、AI代理和团队讨论集中到专属频道中。团队成员可以查看代码变更、预览网页效果,并在上线前提供反馈和审批。
阅读全文Binance推出Agent OS,让开发者可将ChatGPT、Claude Code、Cursor等AI工具接入交易、支付和链上服务。代理能够代用户下单,但风险控制主要依赖用户配置子账户和权限。
阅读全文Co-RL提出一种协作式多智能体强化学习框架,让多个不共享参数的模型通过彼此反馈获得奖励。在没有人工标注或可验证真值的情况下,模型仍能提升文本与多模态推理表现。
阅读全文FM-Bench把大模型放进一个持续20年的足球管理环境,观察它们如何在预算、交易、续约、青训和董事会压力下做出连贯决策。结果显示,真正拉开差距的不是模型规模或推理花费,而是管理行为。
阅读全文一项研究提出用序列标注替代孤立的Token打分,将文本统计、NLI蕴含关系和语言模型惊异度融合起来检测幻觉。BiGRU在RAGTruth上取得0.840 AUC,并显示时间上下文比单纯增加模型容量更关键。
阅读全文Zetta 提出一种闭环具身智能框架:在冻结基础策略的前提下,在线进化运行时批评器与恢复技能。它将动作级干预、回合级复盘和验证式更新结合起来,提升机器人在复杂环境中的执行可靠性。
阅读全文OmniScientist试图把AI科学家的能力从文本和预处理特征扩展到图像、信号、音频、视频、三维结构等异构原始数据。系统通过感知、构思、实验和写作环节,完成从研究问题到论文草稿的端到端流程。
阅读全文杰富瑞分析师围绕五类真实办公任务测试了八款全球主流Agent,阿里千问办公在综合表现和隐含Harness评分上排名第一。测试也显示,Agent竞争正从单纯比模型能力转向比任务完成质量与执行成本。
阅读全文FreeToken 提出一种面向边缘设备的 MoE 服务系统,不再把个人电脑简单视为“缩小版 GPU”,而是将 CPU、GPU、内存与存储统一调度。论文展示了在消费级和工作站硬件上运行更大开放权重模型的可能性。
阅读全文Agent Lightning v1.0提出“框架原生智能体强化学习”范式,让部署时负责工具调用、上下文管理和流程控制的智能体框架直接参与模型后训练。实验显示,仅用6000个训练样本和有限算力,Qwen3.5-9B在SWE-bench Verified上的成绩从41.8%提升至56.4%。
阅读全文一项覆盖多种记忆存储方式的统一评估显示,记忆系统的优劣取决于任务、上下文长度和运行成本。对长期运行的智能体而言,动态选择记忆基底可能比寻找单一最优方案更重要。
阅读全文HarnessRisk 将智能体安全拆分为六个运行阶段,并通过 128 个沙盒案例考察模型与 harness 如何共同应对嵌入不可信工作流的攻击指令。研究显示,安全风险并不只来自模型输出,也可能源于配置、状态和权限控制。
阅读全文一项基于AI-Infra-Guard的研究,对DeepSeek Harness进行了1.456万次受控执行测试。结果显示,隐藏Unicode、伪造完成信息等间接提示注入方式,仍可能影响代理行为,防护重点应从模型本身延伸到工具与敏感操作之间。
阅读全文一项数学人工智能研究提出 FAR 流程:让专家提供研究方向,由系统从文献中寻找开放问题,再逐层筛选值得投入推理与人工复核的候选。组合数学试验显示,这种“文献到评审”的协作方式有望重新分配稀缺的模型推理和专家时间。
阅读全文一项跨基准、框架和模型的研究发现,Agent Skills的主要价值并非补充事实,而是把混乱的执行轨迹转化为稳定的操作程序。与此同时,技能检索会随着候选池扩大迅速成为新的瓶颈。
阅读全文Agentic ESOpt提出以进化策略替代部分长程智能体强化学习流程,通过参数空间搜索完成全参数优化,并以较低的训练显存需求适配更大的语言模型。
阅读全文