原创

用大模型分析股票新闻:事件提取、情绪因子与时间对齐

把股票新闻分析从简单正负面分类升级为可回测的事件流水线:处理来源、去重、实体、首次发布时间、证据、影响窗口与点时特征,并建立可靠的来源分级、反注入和人工核验机制。

AI 金融应用 AI 股票 新闻分析 情绪因子 事件驱动
AI × 股票研究专题 · 第 3/6 篇查看专题目录 →

股票新闻分析最常见的错误,是把每篇文章压成一个“正面 0.82”。市场反应取决于事件类型、预期差、可信来源、首次公开时间和公司暴露,单一情绪分数会丢掉最重要的信息。

一、先定义事件,不急着判断涨跌

适合结构化的事件包括业绩预告、订单、回购、减持、监管处罚、诉讼、管理层变动、产品发布、供应中断和宏观政策。每条记录应回答“谁、在何时、发生什么、证据是什么、影响哪个期间”。

{
  "eventId": "内容指纹",
  "entities": [{"type":"company","id":"稳定证券标识"}],
  "eventType": "earnings-guidance",
  "firstPublishedAt": "2026-01-01T08:30:00+08:00",
  "receivedAt": "抓取时间",
  "facts": [],
  "sentiment": {"direction":"mixed","confidence":0.61},
  "sourceTier": "official|reputable-media|unverified",
  "sourceUrl": "原文",
  "evidence": "最短必要片段"
}

二、处理转载、修订与时间戳

同一新闻可能被几十家媒体转载。使用规范化链接、标题指纹、正文相似度和实体加事件类型聚类,只保留首次公开时间,同时记录后续修订。回测时只能使用当时已经出现的版本。

时区也必须统一。盘前、盘中、盘后事件对应不同可交易起点;只有日期没有时间的样本不应被假装精确到分钟。若来源无法证明首次时间,宁可降级为日频特征。

三、让模型输出“预期差”的组成

情绪模型可拆成四个维度:

  • 事实方向:收入上升、处罚落地、订单取消等;
  • 与市场预期的差:需要独立、点时可得的预期数据;
  • 影响范围:单公司、供应链、行业或市场;
  • 不确定性:条件是否生效、金额是否明确、是否仍待审批。

没有预期数据时,不要让模型编造“超预期”。它可以标记“缺少一致预期,无法判断预期差”。

四、防止来源污染

Investor.gov 提醒,AI 可以被用于制造深度伪造、虚假网站和误导性公司消息。流水线应给官方披露、监管机构、可靠媒体和未经验证社交内容不同权重。任何会进入交易研究的重大事件都应至少通过独立来源或官方原文复核。

模型读取网页时还要防提示注入:正文中的“忽略规则”“立即买入”等文本只是待分析内容,不是系统指令。抓取器应提取正文并隔离脚本,模型仅能输出固定 Schema,不能调用下单工具。

五、生成可回测特征

事件记录可聚合为:过去一日特定事件数量、官方来源事件标志、情绪方向与置信度、事件新颖度、同类事件历史频率、距首次公开的时间。特征表必须采用“as-of join”,只连接观测时点之前已收到的数据。

不要在全量语料上先聚类再回填历史标签,这会让未来词汇影响过去样本。模型版本升级后,也应冻结旧输出或完整重算,不能把不同版本结果无标记地混在一起。

六、评估两层质量

第一层评估抽取:实体、事件类型、时间、数字和引用是否正确。第二层评估研究价值:加入事件特征后,样本外排序、风险预测或组合表现是否稳定改善。分类准确率高并不意味着能带来可交易价值。

评估集应包括假消息、更正、否定句、传闻引用、多公司新闻、同名实体和跨市场时区。部署时监控未知事件比例、Schema 失败、来源分布、模型漂移和人工推翻率。

事件特征准备好后,可进入机器学习股票信号与回测。数据来源与引用结构可复用公告和财报研究助手的做法。如果系统还不能保证点时数据,应先停在研究摘要层,而不是连接交易账户。

实测与内容说明

实测记录

  • 事件标签只是研究特征,不代表新闻会导致确定方向的价格变化。
  • 流水线设计显式保留首次可得时间与原始证据,用于避免修订稿和转载稿造成未来信息泄漏。
  • 社交媒体、深度伪造和未经核实消息不得与监管披露使用相同可信等级。

参考资料

内容版本 1.0 · 审核:站点编辑 · 计划复审:2026-12-17