SteeraMed Bench:衰老模块工程化测试床

332 个衰老模块 × 1,916 个药物的测评坐标系。AI Agent 驱动的提议-评分-反思-精炼循环,开放源代码。

更新时间:2026-08-21
SteeraMed Bench衰老模块工程化AI Agent提议评分反思精炼332 模块1916 药物GitHubDeepoMe

什么是 SteeraMed Bench

SteeraMed Bench 是一个衰老模块工程化测试床(Hallmark Engineering Testbed),覆盖 332 个衰老模块 × 1,916 个药物,由 AI Agent 驱动的"提议-评分-反思-精炼"四阶段循环构成。

Bench 的核心问题:AI 能发现新的衰老模块吗?——选择 PubMed 上的新兴概念,看 AI Agent 如何生成、评估、精炼模块,所有结果来自 SteeraMed 论文 Section 2.7 的预计算数据。


一、为什么需要 Bench

现状问题

衰老标志(Hallmarks of Aging)的发现长期依赖专家共识。一旦发表 12 大标志,新模块的发现就面临三个难题:

  1. 缺乏统一坐标系:不同研究用不同基因集、通路、模块定义,无法横向比较
  2. 缺乏自动化评估:人工审稿周期长,主观性强
  3. 缺乏可复现流程:模块定义依赖作者选择,结果难以重现

Bench 的目标

建立模块化、可复现、AI 驱动的衰老模块发现流水线,让任何研究者都能:

  • 提交一个 PubMed 新兴概念
  • 让 AI Agent 自动提议模块候选
  • 用标准指标(recall@20 等)评估模块质量
  • 通过反思-精炼循环迭代优化

二、四大核心流程

2.1 提议(Propose)

AI Agent 阅读 PubMed 新兴概念文本,结合现有模块库,提议候选基因集合。

2.2 评分(Score)

用 SteeraMed 内置指标评估模块:

  • Δrecall@20:加入新模块后 Top-20 药物召回率的变化
  • 正值:模块带来增量信息
  • 负值:模块不优于现有集合
  • ★ 名义正:统计上名义显著

2.3 反思(Reflect)

Agent 对负值或低分模块进行诊断,识别失败原因(基因选择偏差、通路覆盖不足、文献过时等)。

2.4 精炼(Refine)

基于反思结果,调整基因集合或模块边界,重新评分,循环迭代。


三、典型衰老模块示例

来自 SteeraMed Bench Demo 的 7 个衰老模块案例:

模块 主题 Δrecall@20 状态
溶酶体膜通透化 衰老性细胞死亡机制 -0.020 评估中
组织驻留巨噬细胞胞葬作用 衰老细胞清除 +0.021 ★ 名义正
p21-TREM2 轴驱动的衰老巨噬细胞 代谢疾病驱动 -0.019 评估中
铁死亡防御机制 铁依赖脂质过氧化抑制 -0.040 评估中
NAD+ 补救与循环代谢 代谢衰老干预靶点 -0.010 评估中
细胞外基质硬化与机械转导 提议的第 13 大衰老标志 +0.031 ★ 名义正
意义不明的克隆性造血 衰老与心血管疾病联系 -0.010 评估中

这些模块都是从近期 PubMed 文献中提取的"候选新模块",由 AI Agent 评估它们能否被加入 SteeraMed 的标准模块库。


四、技术规格

维度 规格
模块数量 332
药物数量 1,916
数据源 PubMed 衰老文献 + STRING PPI + STITCH 化合物-靶点
评估指标 Δrecall@20, F1, 稳定性
自动化 AI Agent 提议-评分-反思-精炼四阶段
开放性 完全开源(GitHub)
配套论文 SteeraMed 论文 Section 2.7

五、与 SteeraMed 框架的关系

SteeraMed 框架(可驾驭世界模型)   ├── Bench(衰老模块工程化测试床)   │    ├── 332 模块定义   │    ├── 1,916 药物评估   │    └── AI Agent 自动化流水线   ├── Map(个人状态与产业工作流地图)   │    ├── 个人状态投影   │    └── 产业研究工具   └── Paper(论文与证据链)         ├── 理论框架         ├── DNet 依赖网络         └── 四疾病回顾性验证

Bench 是 SteeraMed 框架的工程化骨架——把"衰老标志"从静态分类升级为可被 AI 持续探索、验证、扩展的动态模块库。


六、应用场景

6.1 学术研究

  • 衰老机制新假说的快速验证
  • 跨实验室模块定义的统一标准
  • 大规模文献挖掘与基因集合发现

6.2 药物发现

  • 已有药物的衰老适应症(drug repositioning)评估
  • 新靶点候选的模块归属判断
  • 模块级富集分析替代单基因/通路方法

6.3 临床转化

  • 个体化干预方案的模块化解释
  • N=1 试验的疗效归因
  • 跨患者疗效比较的统一语言

七、如何使用 Bench

在线体验

访问 steeramed.com/zh/bench/ 选择一个衰老模块,点击"运行 AI Agent"即可观察完整的提议-评分-反思-精炼过程。

本地部署

克隆仓库:git clone https://github.com/DeepoMe/SteeraMed-bench.git

安装依赖:pip install -r requirements.txt

运行 Agent:python run_agent.py --module lysosomal_membrane_permeabilization

自定义模块

通过 YAML 配置文件定义新模块:

  • name:模块名称(如 my_custom_module)
  • genes:基因列表(如 [GENE1, GENE2, ...])
  • evidence:PubMed 引用 ID
  • drugs:药物数量(默认 1916)
  • recall_k:召回率计算的 K 值(默认 20)

八、与 SteeraMed Map 的协同

维度 Bench Map
抽象层级 模块(数学定义) 状态(用户投影)
核心问题 哪些模块可驾驭 个体当前在哪个状态
输入 候选模块描述 DNA 甲基化/临床表型
输出 Δrecall@20 等指标 干预建议 + 证据链
角色 工程化测试床 个体化导航地图

Bench 回答"什么可驾驭",Map 回答"我现在在哪儿、可以去哪儿"。


相关资源

常见问题(FAQ)

这些答案由AI辅助整理,如有疑问请咨询专业人士。

SteeraMed Bench 包含多少模块和药物?
SteeraMed Bench 包含 332 个衰老模块 × 1,916 个药物的测评坐标系。所有模块定义、药物列表、评估脚本都开源于 GitHub(DeepoMe/SteeraMed-bench)。
AI Agent 在 Bench 中做什么?
AI Agent 驱动"提议-评分-反思-精炼"四阶段循环:(1)阅读 PubMed 概念文本,提议候选基因集合;(2)用 Δrecall@20 等标准指标评估;(3)对失败模块诊断原因;(4)调整基因集合,重新评分。整个流程可复现、可审计。
Δrecall@20 指标如何解读?
Δrecall@20 表示加入新模块后,Top-20 药物召回率的变化。正值(如 +0.021)表示模块带来增量信息;负值(如 -0.040)表示模块不优于现有集合;★ 标记表示统计上名义显著(p<0.05)。
Bench 与 Map 是什么关系?
Bench 回答"什么可驾驭"——评估衰老模块的工程化指标;Map 回答"我现在在哪儿、可以去哪儿"——把个体状态投影到模块网络。两者协同:Bench 提供模块定义与药物评分,Map 把这些定义用于个体化导航。
如何参与 Bench 的模块贡献?
可以通过 GitHub 提交 PR 添加新模块定义(YAML 格式),或在 steeramed.com/zh/bench/ 在线提交 PubMed 概念让 AI Agent 自动评估。贡献的模块经论文作者审核后可纳入主分支。