Flow brief · 内部分享
2026-08-28 · fin-twitter-eval

Eval gap note

金融社媒 Eval 缺什么,TweetEval 能借什么

公开世界不缺金融评测,缺的是金融 Twitter / specialist chatter 的产品级评测。 TweetEval 值得借的是统一考场骨架,不是它的任务标签。

1. 缺口在哪

很多金融信息确实在 X/Twitter,但公开评测很少覆盖「这条该不该进 desk digest」。

场景 公开 eval 覆盖 对我们的含义
财报数值 QA / filing 问答 FinQA、FinanceBench、FAB 可作能力下限
新闻/短语情感分类 FPB、FiQA 只是基线,标签偏新闻
金融 Twitter stock sentiment 低–中 TweetFinSent 等近邻有,但远不够产品 KPI
digest 排序、去重、漏报重大传闻、RT/quote 误读 几乎无 必须自建 as-of golden + 高代价错误表

所以分享时请说清「这类」:指的是社媒金融信号与 digest 产品质量, 不是否定 FinQA / FinanceBench 那一类财报评测。

2. TweetEval 是什么

Cardiff NLP(EMNLP 2020 Findings)的英文推文分类统一基准,类似「推文版 GLUE」。

核心贡献不是某个数据集本身,而是:统一 schema、固定 split、同一评测脚本,让模型分数可比较。 Hugging Face:cardiffnlp/tweet_eval

3. 借什么 / 不借什么

值得借 · 方法论

  • 少量稳定任务卡,而不是无限标签
  • 统一输入输出契约
  • 固定 golden / as-of,禁止随意改测集
  • 同一指标做纵向对比
  • 承认短文本噪声:反讽、缩写、quote/RT

不要借 · 任务内容

  • hate / emoji / irony 等标签语义
  • 用 TweetEval 分数指导金融系统
  • 单标签 F1 当唯一产品指标
  • 把通用情绪当成 buyside 相关性

更近的金融 Twitter 参考是 TweetFinSent:按「对某股票预期涨跌」标情感, 明确区分 stock sentiment ≠ 情绪好坏。仍只是分类任务,不是 digest 评测。

4. 公开金融 eval 地图(精简)

Benchmark 测什么 何时看
FinQA / ConvFinQA / TAT-QA 财报表格多步算术 数值读写下限
FinanceBench SEC/earnings 开放书 QA + 证据 幻觉与检索下限
FinBen 多任务打包摸底 横向扫模型,不当主 KPI
Finance Agent / FABv2 工具调用 + filing 研究工作流 只在做 agent 时跟
TweetFinSent / StockNet 金融推文情感 / 涨跌预测 社媒近邻;难转产品指标

5. 我们该建什么

公开集只做 capability smoke test;产品迭代靠内部冻结 case。

输入单位:tweet atom(quote / reply / RT / thread / author / time) 任务卡(少量、稳定): 1. relevance_to_universe 2. claim_type (fact | rumor | opinion | joke) 3. ticker / theme binding 4. directional stance (仅当文本显式) 5. should_surface_in_digest 冻结:author set + as-of + golden labels + failure taxonomy 指标:分任务 macro-F1 + 高代价错误率(漏重大传闻、旧闻当新、RT 当原创)