Eval gap note
金融社媒 Eval 缺什么,TweetEval 能借什么
公开世界不缺金融评测,缺的是金融 Twitter / specialist chatter 的产品级评测。 TweetEval 值得借的是统一考场骨架,不是它的任务标签。
1. 缺口在哪
很多金融信息确实在 X/Twitter,但公开评测很少覆盖「这条该不该进 desk digest」。
| 场景 | 公开 eval 覆盖 | 对我们的含义 |
|---|---|---|
| 财报数值 QA / filing 问答 | 高 | FinQA、FinanceBench、FAB 可作能力下限 |
| 新闻/短语情感分类 | 中 | FPB、FiQA 只是基线,标签偏新闻 |
| 金融 Twitter stock sentiment | 低–中 | TweetFinSent 等近邻有,但远不够产品 KPI |
| digest 排序、去重、漏报重大传闻、RT/quote 误读 | 几乎无 | 必须自建 as-of golden + 高代价错误表 |
所以分享时请说清「这类」:指的是社媒金融信号与 digest 产品质量, 不是否定 FinQA / FinanceBench 那一类财报评测。
2. TweetEval 是什么
Cardiff NLP(EMNLP 2020 Findings)的英文推文分类统一基准,类似「推文版 GLUE」。
- sentiment — 正/中/负
- emotion — 细粒度情绪
- hate / offensive / irony — 仇恨、冒犯、讽刺
- stance — 对议题立场
- emoji — emoji 预测
核心贡献不是某个数据集本身,而是:统一 schema、固定 split、同一评测脚本,让模型分数可比较。
Hugging Face:cardiffnlp/tweet_eval。
3. 借什么 / 不借什么
值得借 · 方法论
- 少量稳定任务卡,而不是无限标签
- 统一输入输出契约
- 固定 golden / as-of,禁止随意改测集
- 同一指标做纵向对比
- 承认短文本噪声:反讽、缩写、quote/RT
不要借 · 任务内容
- hate / emoji / irony 等标签语义
- 用 TweetEval 分数指导金融系统
- 单标签 F1 当唯一产品指标
- 把通用情绪当成 buyside 相关性
更近的金融 Twitter 参考是 TweetFinSent:按「对某股票预期涨跌」标情感, 明确区分 stock sentiment ≠ 情绪好坏。仍只是分类任务,不是 digest 评测。
4. 公开金融 eval 地图(精简)
| Benchmark | 测什么 | 何时看 |
|---|---|---|
| FinQA / ConvFinQA / TAT-QA | 财报表格多步算术 | 数值读写下限 |
| FinanceBench | SEC/earnings 开放书 QA + 证据 | 幻觉与检索下限 |
| FinBen | 多任务打包摸底 | 横向扫模型,不当主 KPI |
| Finance Agent / FABv2 | 工具调用 + filing 研究工作流 | 只在做 agent 时跟 |
| TweetFinSent / StockNet | 金融推文情感 / 涨跌预测 | 社媒近邻;难转产品指标 |
5. 我们该建什么
公开集只做 capability smoke test;产品迭代靠内部冻结 case。
输入单位:tweet atom(quote / reply / RT / thread / author / time)
任务卡(少量、稳定):
1. relevance_to_universe
2. claim_type (fact | rumor | opinion | joke)
3. ticker / theme binding
4. directional stance (仅当文本显式)
5. should_surface_in_digest
冻结:author set + as-of + golden labels + failure taxonomy
指标:分任务 macro-F1
+ 高代价错误率(漏重大传闻、旧闻当新、RT 当原创)
- 公开评测 = 校准模型有没有基本金融读写能力
- 内部评测 = 决定 digest / radar / message 产品能不能上线迭代
- 现有 message-emotion golden + rubric 路线,比单刷公开榜更接近真实工作流