强化学习和多智能体是 AI 股票应用的高级形态,也最容易产生“演示很聪明、上线很危险”的错觉。复杂度只有在数据、基线、回测和风险控制都成熟后才有意义。
一、强化学习系统到底学习什么
交易环境通常包含状态、动作、奖励和转移。状态可包括持仓、现金、价格特征、风险和市场状态;动作是目标仓位或买卖数量;奖励可以基于净资产变化并扣除成本和风险惩罚。进入这一阶段前应先完成组合优化与风险控制中的硬限制设计。
奖励设计决定模型追求什么。只奖励短期收益会鼓励高换手和极端风险。更合理的环境会加入交易成本、流动性、风险厌恶、仓位和市场限制。FinRL 的论文也将交易成本、流动性与风险厌恶列为环境约束,但使用框架并不等于策略已经可用。
二、模拟器与现实的差距
历史数据无法完整呈现你的订单对市场的影响、排队成交、停牌和基础设施故障。智能体可能利用模拟器漏洞,例如在收盘价知道后仍按该价格成交。
验收时进行行为审计:动作是否集中在特定时间、收益是否来自少数异常样本、移除一个特征后是否崩溃、成本提高后是否仍稳定、随机延迟和成交失败时会怎样。若策略无法解释收益来源,自动化等级应保持在研究或影子模式。
三、多智能体更适合研究分工
多智能体系统可以将任务分成:
- 数据代理:检查来源、时间戳与缺失;
- 公告代理:基于原文提取事实;
- 事件代理:识别新闻事件和冲突;
- 量化代理:运行冻结代码与回测;
- 风险代理:检查暴露、成本与限制;
- 审核代理:汇总证据和未解决分歧。
这些角色应围绕共享的结构化研究对象协作,而不是互相发送长篇自由文本。每个结论都带证据 ID,冲突被保留,最终报告区分事实、模型推断和人工决定。
四、工具权限必须最小化
研究代理只需要读取文档和调用受限分析函数。代码执行放在隔离环境,数据查询使用只读凭据。任何真实交易接口应与 LLM 物理隔离,由确定性订单服务接收经过审批和签名的目标指令。
防止提示注入的核心不是一句系统提示,而是权限边界:网页内容不能改变工具白名单,模型不能读取账户密钥,输出必须通过 Schema 和规则验证,异常调用全部记录并限速。
五、评估不能只看最终收益
强化学习至少与等权、简单因子、监督学习和不交易基线比较。跨多个起止区间、市场状态和成本假设测试,最终保留完全隔离的样本外时期。
多智能体还要评估任务完成率、事实引用正确率、分歧发现率、工具失败恢复、调用成本和人工推翻率。让多个模型重复同一个错误不会自动提高可靠性。
六、生产发布阶梯
- 离线历史重放:固定数据与代码,可重复结果;
- 前向影子运行:实时接收数据,但不生成订单;
- 纸面交易:模拟订单生命周期与拒单;
- 极小范围试运行:白名单、额度和人工审批;
- 有条件自动化:仍保留硬限制、实时监控和停机。
每一级都定义回退条件。数据延迟、分布漂移、异常换手、风险超限、解释缺失或服务不一致时,应自动降级到无交易状态。
七、用治理框架约束复杂系统
NIST AI RMF 用治理、映射、测量和管理组织 AI 风险。落到交易研究中,就是明确负责人和风险容忍度,描述使用场景和受影响对象,持续测量事实错误与系统行为,并用权限、监控、人工接管和事件响应管理风险。
八、为失败设计恢复路径
生产演练应主动注入行情断流、重复消息、模型超时、订单拒绝、部分成交、账户状态不同步和时钟偏移。系统需要证明它会停止新增风险、对账当前状态、通知负责人,并在人工确认后恢复。恢复过程不能依赖产生故障的同一个模型。
还应定期做权限审计:哪些代理能读原始数据、哪些能执行代码、哪些能生成建议、谁能批准订单。研究环境中的新工具默认无权访问交易服务。模型或提示词更新后重新经过离线、影子和纸面交易,而不是热切换到真实资金。
高级系统的完成标准不是“Agent 能讨论股票”,而是任何一次结论和动作都能回答:用的哪版数据与模型、看到了什么证据、经过哪些规则、谁批准、如何停止和如何复盘。建议同时回看AI 股票应用路线图,确认没有跳过前面的数据和回测基础。