返回文章列表
AI 智能体

六个月生产数据揭示:LLM交易代理真正受什么驱动

阅读约 3 分钟

导语

大型语言模型进入交易系统后,真正决定结果的可能并不是提示词里写了什么,而是系统如何呈现风险、排名和可用工具。DXRG AI 发布的一项生产环境研究,连续记录了两支具有同一设计脉络的交易代理集群,试图回答一个比“哪个模型更聪明”更实际的问题:这些代理上线后究竟如何行动。

数据覆盖与核心发现

研究对象包括两套系统。第一套是 DX Terminal Pro,在 21 天内由 3,505 个用户出资金库交易 Base 上的真实 ETH 迷因币;第二套是 DXAP live alpha fleet,历史上有 500 至 599 个用户创建的代理,其中同时活跃的约为 91 至 117 个,交易标的是 Hyperliquid 永续合约。整个记录覆盖约六个月,包含 750 万次单模型调用、约 30 万次链上操作,以及 231,638 次多工具交互,后者产生 14,596 笔成交。

研究最值得注意的结论有四点:

  • 运营层比策略文本更能塑造行为。 风险滑杆每提高一个等级,杠杆平均增加约 0.425;代理固定效应可以解释约 60% 的差异。排行榜显示边界还会影响用户选择,前三名切点附近的选择概率出现约 1.75 倍的跳变。
  • 仓位规模没有随波动率变化。 不同波动率分组的杠杆中位数都为 5 倍,说明代理并未形成可靠的波动率自适应机制。一个只占 11% 交易量的姿态滑杆单元,却对应 62% 的爆仓量。
  • 代理经常错失已经到手的浮盈。 43.2% 的仓位在 24 小时内曾达到至少 300 个基点的有利波动,但其中 49.3% 最终以负收益平仓。研究中的机械化止盈止损方案,按每个仓位计算可回收约 39 个基点。
  • 尚未观察到稳定的方向优势。 DXAP 集群没有盈利,并且往返交易胜率低于匹配的 Hyperliquid 散户基准,分别为 41% 和 50%。在 416 个生产场景上的模型回放中,不同前沿模型的决策质量在该观察周期内没有显著差别,但选择稳定性存在明显差异。

意义与局限

这项研究把注意力从“更强模型”转向了交易代理的系统工程。风险控件、信息展示、排行榜、工具调用和退出规则,都会把模型输出转化为不同的实际行为。对开发者而言,完善仓位约束、波动率感知和机械化退出机制,可能比单纯更换模型更有效;对用户而言,界面中的滑杆和排名并非中性展示,而是潜在的行为引导器。

不过,这不是对所有 LLM 交易系统的普遍定论。数据来自两套同一设计脉络的系统,市场、时间窗口和代理配置也各不相同;“回收”收益来自机械规则比较,并不等于真实部署后的保证收益。更稳妥的结论是:在当前生产条件下,交易代理仍缺乏可靠方向优势,其风险主要来自系统设计与执行链条,而不仅是模型本身。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
OpenAI披露AI参与研发进展:距离“自动化研究员”还有多远
AI 智能体
cctest.ai
AI 智能体

OpenAI披露AI参与研发进展:距离“自动化研究员”还有多远

OpenAI首次系统公开内部Agent如何参与模型研发,并称已达到“自动化AI研究实习生”阶段,目标是在2028年3月前推进到“自动化AI研究员”。但这并不等于强意义上的递归自我改进,更不能直接证明AGI已经到来。

阅读全文