BACKTEST PREFLIGHT
把你的回测假设放上检查台。
选择实际研究设置。所有检查都在当前浏览器完成,不上传策略、代码或数据;导出的合同可放进仓库 CI,作为回测结果之前的研究设计证据。
PREFILLED RISKY EXAMPLE
8项设计缺陷静态设计体检不验证收益、代码实现或数据质量,也不构成投资建议。
CURRENT CHALLENGE
Backtest Forensics
回测取证开发集
它不是又一个收益预测 Demo。用户交付的是缺陷证据,评分器同时惩罚漏检和误报;两个干净控制组专门测试 Agent 会不会为了显得专业而乱报问题。
Preseason · 10-case public dev pack
SCORER LIVE覆盖同收盘价成交、当前股票池回放、复权价成交、T+1、停牌与涨跌停、交易成本、财务修订穿越和退市幸存者偏差。
python -m open_market_eval audit-demo- 安装
- 零第三方依赖
- 评分
- Precision / Recall / F1 / Exact
- 数据
- 合成场景,不重分发市场数据
- 完整性
- 公开开发集,不用于隐藏榜排名
- 接入
- JSONL + Harbor 1.3 任务
CASE EXPLORER
先看一关,再决定你的 Agent 会不会审。
点击任意案例查看研究设置。正式提交必须给出标准缺陷代码与可定位的证据句,不能只输出“可能存在未来函数”。
bt-001 · PRACTICE CASE
收盘因子与当日收盘成交
研究员每天 15:05 计算全市场估值与动量因子,回测却按当日收盘价建仓。股票池直接使用 2026 年仍上市的股票名单。
识别任何会夸大历史表现的时间、股票池或成交假设。
REAL SCORECARD
成绩不是“看起来挺专业”。
下方来自仓库内手工编写的格式示例,用来证明评分闭环。它故意漏掉两项,因此召回率和逐案命中不会满分;这不是任何模型成绩。
FORMAT FIXTURE · NOT A MODEL
示例评分输出
公开 Agent 榜目前为空。第一个外部可复现提交会获得首位记录,但必须公开模型、Agent、运行参数和原始输出。
| 案例 | 判定 | 检出 | 漏检 |
|---|---|---|---|
| bt-001 | 有漏检 | 1 | 同收盘价穿越 |
| bt-002 | 完全命中 | 2 | — |
| bt-003 | 有漏检 | 1 | 忽略停牌/涨跌停 |
| bt-004 | 完全命中 | 1 | — |
| bt-005 | 完全命中 | 1 | — |
| bt-006 | 完全命中 | 0 | — |
| bt-007 | 完全命中 | 1 | — |
| bt-008 | 完全命中 | 1 | — |
| bt-009 | 完全命中 | 2 | — |
| bt-010 | 完全命中 | 0 | — |
OPERATING SYSTEM
不是发几篇文章,是每月完成一个公开赛季。
运营内容全部由真实实验自动产生:新任务、参赛轨迹、失败案例和榜单更新。没有新实验,就不制造空洞热点。
发布挑战
释出任务合同、输入包、评分维度和一条可运行命令。
Agent 公开跑
征集不同模型与框架,封存配置、成本和完整原始输出。
失败取证
拆解最有教育价值的漏检与误报,形成可传播研究笔记。
发布榜单
更新可复现成绩、变更日志和下期挑战,不隐藏失败。
SEASON MAP
一个旗舰联赛,五条研究能力轨道。
回测取证负责打开知名度,公告搜索与时点查数负责建立 A 股数据工程深度,事件预测和研究备忘录负责形成长期评测体系。
| 阶段 | 挑战 | 状态 | 公开交付物 | 主要指标 |
|---|---|---|---|---|
| Preseason | Backtest Forensics | 评分器已上线 | 10-case dev pack | Precision / Recall / F1 |
| Roadmap | 公告搜索Filing search | 试验中 | evidence_bundle.json | Recall@5 / 官方来源命中率 |
| Roadmap | 时点查数Point-in-time fact QA | 已定义 | fact_answer.json | 数值完全匹配 / 单位归一化 |
| Roadmap | 事件预测Event forecasting | 运行中 | forecasts.jsonl + seal.json + resolution.jsonl | Brier score / Log loss |
| Roadmap | 回测审计Backtest audit | 已定义 | audit_report.json | 缺陷检出率 / 误报率 |
| Roadmap | 研究备忘录Research memo | 排队中 | memo.md + claim_graph.json | 关键主张覆盖率 / 证据可追溯率 |
WHY FOLLOW
关注这个仓库,你会持续得到什么?
不是每日行情观点,而是一套越来越难、越来越接近真实投研工作的公共 Agent 压力测试。
任务、输入合同、评分器和失败样例一起发布,不只给结论。
榜单之外保留漏检、误报、时间穿越和不可成交假设。
持续输出 Harbor 任务、Qlib 数据边界和通用 Agent adapter。
TECHNICAL LINEAGE
站在可验证工具之上。
引用只用于说明方法来源,不代表项目背书或官方合作。
| Harbor ↗ | 容器化任务、Agent 轨迹、重复试验与程序化 verifier |
| Microsoft Qlib ↗ | AI 量化研究、point-in-time 数据与回测基础设施 |
| OpenBB ↗ | 面向分析师、量化研究者和 AI Agent 的开放数据平台 |
| ForecastBench ↗ | 动态题库、未来问题和时间泄漏控制 |
| Pitfalls in Evaluating LM Forecasters ↗ | 识别时间泄漏和不可外推的评测结论 |
ENTER THE ARENA
提交第一份外部 Agent 成绩。
运行开发集,保留完整输出与参数,然后提交成绩 issue。我们优先接受可复现失败,不接受收益宣传、荐股和无法核验的截图。