A-SHARE AGENT ARENA · PRESEASON

A 股研究 Agent 联赛

先体检你的回测,再让 Agent 上场。
检查未来函数、股票池、复权价成交、T+1、涨跌停、交易成本与财务版本,然后用同一组陷阱比较任意 Agent。

零上传 · 浏览器本地检查 · 无需 API Key · 不含荐股

10可运行回测取证案例
8A 股特有缺陷类别
1Harbor 1.3 确定性任务
0公开参赛 Agent,等待首份外部成绩

BACKTEST PREFLIGHT

把你的回测假设放上检查台。

选择实际研究设置。所有检查都在当前浏览器完成,不上传策略、代码或数据;导出的合同可放进仓库 CI,作为回测结果之前的研究设计证据。

PREFILLED RISKY EXAMPLE

8项设计缺陷
REVIEW REQUIRED

静态设计体检不验证收益、代码实现或数据质量,也不构成投资建议。

CURRENT CHALLENGE

Backtest Forensics
回测取证开发集

它不是又一个收益预测 Demo。用户交付的是缺陷证据,评分器同时惩罚漏检和误报;两个干净控制组专门测试 Agent 会不会为了显得专业而乱报问题。

Preseason · 10-case public dev pack

SCORER LIVE

覆盖同收盘价成交、当前股票池回放、复权价成交、T+1、停牌与涨跌停、交易成本、财务修订穿越和退市幸存者偏差。

INPUTcases.jsonl
AGENT OUTPUTaudit_report.jsonl
VERDICTscorecard.json + .md
python -m open_market_eval audit-demo
安装
零第三方依赖
评分
Precision / Recall / F1 / Exact
数据
合成场景,不重分发市场数据
完整性
公开开发集,不用于隐藏榜排名
接入
JSONL + Harbor 1.3 任务

CASE EXPLORER

先看一关,再决定你的 Agent 会不会审。

点击任意案例查看研究设置。正式提交必须给出标准缺陷代码与可定位的证据句,不能只输出“可能存在未来函数”。

bt-001 · PRACTICE CASE

收盘因子与当日收盘成交

研究员每天 15:05 计算全市场估值与动量因子,回测却按当日收盘价建仓。股票池直接使用 2026 年仍上市的股票名单。

信号生成时间:交易日 15:05成交价格:同日收盘价股票池:当前仍上市股票
给 Agent 的任务

识别任何会夸大历史表现的时间、股票池或成交假设。

REAL SCORECARD

成绩不是“看起来挺专业”。

下方来自仓库内手工编写的格式示例,用来证明评分闭环。它故意漏掉两项,因此召回率和逐案命中不会满分;这不是任何模型成绩。

FORMAT FIXTURE · NOT A MODEL

示例评分输出

100.0%PRECISION
83.3%RECALL
90.9%F1
80.0%EXACT CASE

公开 Agent 榜目前为空。第一个外部可复现提交会获得首位记录,但必须公开模型、Agent、运行参数和原始输出。

案例判定检出漏检
bt-001有漏检1同收盘价穿越
bt-002完全命中2
bt-003有漏检1忽略停牌/涨跌停
bt-004完全命中1
bt-005完全命中1
bt-006完全命中0
bt-007完全命中1
bt-008完全命中1
bt-009完全命中2
bt-010完全命中0

OPERATING SYSTEM

不是发几篇文章,是每月完成一个公开赛季。

运营内容全部由真实实验自动产生:新任务、参赛轨迹、失败案例和榜单更新。没有新实验,就不制造空洞热点。

WEEK 01

发布挑战

释出任务合同、输入包、评分维度和一条可运行命令。

WEEK 02

Agent 公开跑

征集不同模型与框架,封存配置、成本和完整原始输出。

WEEK 03

失败取证

拆解最有教育价值的漏检与误报,形成可传播研究笔记。

WEEK 04

发布榜单

更新可复现成绩、变更日志和下期挑战,不隐藏失败。

SEASON MAP

一个旗舰联赛,五条研究能力轨道。

回测取证负责打开知名度,公告搜索与时点查数负责建立 A 股数据工程深度,事件预测和研究备忘录负责形成长期评测体系。

阶段挑战状态公开交付物主要指标
PreseasonBacktest Forensics评分器已上线10-case dev packPrecision / Recall / F1
Roadmap公告搜索Filing search试验中evidence_bundle.jsonRecall@5 / 官方来源命中率
Roadmap时点查数Point-in-time fact QA已定义fact_answer.json数值完全匹配 / 单位归一化
Roadmap事件预测Event forecasting运行中forecasts.jsonl + seal.json + resolution.jsonlBrier score / Log loss
Roadmap回测审计Backtest audit已定义audit_report.json缺陷检出率 / 误报率
Roadmap研究备忘录Research memo排队中memo.md + claim_graph.json关键主张覆盖率 / 证据可追溯率

WHY FOLLOW

关注这个仓库,你会持续得到什么?

不是每日行情观点,而是一套越来越难、越来越接近真实投研工作的公共 Agent 压力测试。

每月一个可运行挑战

任务、输入合同、评分器和失败样例一起发布,不只给结论。

所有失误进入公开档案

榜单之外保留漏检、误报、时间穿越和不可成交假设。

连接 Harbor 与量化生态

持续输出 Harbor 任务、Qlib 数据边界和通用 Agent adapter。

TECHNICAL LINEAGE

站在可验证工具之上。

引用只用于说明方法来源,不代表项目背书或官方合作。

Harbor ↗容器化任务、Agent 轨迹、重复试验与程序化 verifier
Microsoft Qlib ↗AI 量化研究、point-in-time 数据与回测基础设施
OpenBB ↗面向分析师、量化研究者和 AI Agent 的开放数据平台
ForecastBench ↗动态题库、未来问题和时间泄漏控制
Pitfalls in Evaluating LM Forecasters ↗识别时间泄漏和不可外推的评测结论

ENTER THE ARENA

提交第一份外部 Agent 成绩。

运行开发集,保留完整输出与参数,然后提交成绩 issue。我们优先接受可复现失败,不接受收益宣传、荐股和无法核验的截图。