SteeraMed Bench:衰老模块工程化测试床
332 个衰老模块 × 1,916 个药物的测评坐标系。AI Agent 驱动的提议-评分-反思-精炼循环,开放源代码。
什么是 SteeraMed Bench
SteeraMed Bench 是一个衰老模块工程化测试床(Hallmark Engineering Testbed),覆盖 332 个衰老模块 × 1,916 个药物,由 AI Agent 驱动的"提议-评分-反思-精炼"四阶段循环构成。
Bench 的核心问题:AI 能发现新的衰老模块吗?——选择 PubMed 上的新兴概念,看 AI Agent 如何生成、评估、精炼模块,所有结果来自 SteeraMed 论文 Section 2.7 的预计算数据。
一、为什么需要 Bench
现状问题
衰老标志(Hallmarks of Aging)的发现长期依赖专家共识。一旦发表 12 大标志,新模块的发现就面临三个难题:
- 缺乏统一坐标系:不同研究用不同基因集、通路、模块定义,无法横向比较
- 缺乏自动化评估:人工审稿周期长,主观性强
- 缺乏可复现流程:模块定义依赖作者选择,结果难以重现
Bench 的目标
建立模块化、可复现、AI 驱动的衰老模块发现流水线,让任何研究者都能:
- 提交一个 PubMed 新兴概念
- 让 AI Agent 自动提议模块候选
- 用标准指标(recall@20 等)评估模块质量
- 通过反思-精炼循环迭代优化
二、四大核心流程
2.1 提议(Propose)
AI Agent 阅读 PubMed 新兴概念文本,结合现有模块库,提议候选基因集合。
2.2 评分(Score)
用 SteeraMed 内置指标评估模块:
- Δrecall@20:加入新模块后 Top-20 药物召回率的变化
- 正值:模块带来增量信息
- 负值:模块不优于现有集合
- ★ 名义正:统计上名义显著
2.3 反思(Reflect)
Agent 对负值或低分模块进行诊断,识别失败原因(基因选择偏差、通路覆盖不足、文献过时等)。
2.4 精炼(Refine)
基于反思结果,调整基因集合或模块边界,重新评分,循环迭代。
三、典型衰老模块示例
来自 SteeraMed Bench Demo 的 7 个衰老模块案例:
| 模块 | 主题 | Δrecall@20 | 状态 |
|---|---|---|---|
| 溶酶体膜通透化 | 衰老性细胞死亡机制 | -0.020 | 评估中 |
| 组织驻留巨噬细胞胞葬作用 | 衰老细胞清除 | +0.021 | ★ 名义正 |
| p21-TREM2 轴驱动的衰老巨噬细胞 | 代谢疾病驱动 | -0.019 | 评估中 |
| 铁死亡防御机制 | 铁依赖脂质过氧化抑制 | -0.040 | 评估中 |
| NAD+ 补救与循环代谢 | 代谢衰老干预靶点 | -0.010 | 评估中 |
| 细胞外基质硬化与机械转导 | 提议的第 13 大衰老标志 | +0.031 | ★ 名义正 |
| 意义不明的克隆性造血 | 衰老与心血管疾病联系 | -0.010 | 评估中 |
这些模块都是从近期 PubMed 文献中提取的"候选新模块",由 AI Agent 评估它们能否被加入 SteeraMed 的标准模块库。
四、技术规格
| 维度 | 规格 |
|---|---|
| 模块数量 | 332 |
| 药物数量 | 1,916 |
| 数据源 | PubMed 衰老文献 + STRING PPI + STITCH 化合物-靶点 |
| 评估指标 | Δrecall@20, F1, 稳定性 |
| 自动化 | AI Agent 提议-评分-反思-精炼四阶段 |
| 开放性 | 完全开源(GitHub) |
| 配套论文 | SteeraMed 论文 Section 2.7 |
五、与 SteeraMed 框架的关系
SteeraMed 框架(可驾驭世界模型) ├── Bench(衰老模块工程化测试床) │ ├── 332 模块定义 │ ├── 1,916 药物评估 │ └── AI Agent 自动化流水线 ├── Map(个人状态与产业工作流地图) │ ├── 个人状态投影 │ └── 产业研究工具 └── Paper(论文与证据链) ├── 理论框架 ├── DNet 依赖网络 └── 四疾病回顾性验证
Bench 是 SteeraMed 框架的工程化骨架——把"衰老标志"从静态分类升级为可被 AI 持续探索、验证、扩展的动态模块库。
六、应用场景
6.1 学术研究
- 衰老机制新假说的快速验证
- 跨实验室模块定义的统一标准
- 大规模文献挖掘与基因集合发现
6.2 药物发现
- 已有药物的衰老适应症(drug repositioning)评估
- 新靶点候选的模块归属判断
- 模块级富集分析替代单基因/通路方法
6.3 临床转化
- 个体化干预方案的模块化解释
- N=1 试验的疗效归因
- 跨患者疗效比较的统一语言
七、如何使用 Bench
在线体验
访问 steeramed.com/zh/bench/ 选择一个衰老模块,点击"运行 AI Agent"即可观察完整的提议-评分-反思-精炼过程。
本地部署
克隆仓库:
git clone https://github.com/DeepoMe/SteeraMed-bench.git安装依赖:
pip install -r requirements.txt运行 Agent:
python run_agent.py --module lysosomal_membrane_permeabilization
自定义模块
通过 YAML 配置文件定义新模块:
- name:模块名称(如 my_custom_module)
- genes:基因列表(如 [GENE1, GENE2, ...])
- evidence:PubMed 引用 ID
- drugs:药物数量(默认 1916)
- recall_k:召回率计算的 K 值(默认 20)
八、与 SteeraMed Map 的协同
| 维度 | Bench | Map |
|---|---|---|
| 抽象层级 | 模块(数学定义) | 状态(用户投影) |
| 核心问题 | 哪些模块可驾驭 | 个体当前在哪个状态 |
| 输入 | 候选模块描述 | DNA 甲基化/临床表型 |
| 输出 | Δrecall@20 等指标 | 干预建议 + 证据链 |
| 角色 | 工程化测试床 | 个体化导航地图 |
Bench 回答"什么可驾驭",Map 回答"我现在在哪儿、可以去哪儿"。
相关资源
- Bench Demo:steeramed.com/zh/bench/
- GitHub 仓库:github.com/DeepoMe/SteeraMed-bench
- SteeraMed 论文:Preprints.org
- SteeraMed Map:map.steeramed.com