十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

药物分子研究:靶点表达量考量与数据库GTEx-HPA实战

药物分子研究:靶点表达量考量与数据库GTEx-HPA实战 表达量的两个陷阱公共库里不存在的靶点做出了镇痛药TPM 打平的靶点血浆池差百倍摘要本文通过两个真实案例揭示靶点表达量数据解读的两大陷阱。其一Nav1.8 在公共数据库GTEx/HPA中几乎全部显示Not detected但真相是这些数据库根本不采集 DRG背根神经节——而 DRG 恰是伤害性感受神经元胞体所在Nav1.8 在那里高表达最终 suzetrigine 成为三十年来首个新型口服镇痛药。其二PCSK9 与 Lp(a) 的肝 TPM 仅差 1.5 倍看似打平但半衰期、分泌速率与遗传多态把血浆池拉开百倍约 2 nM vs 30–250 nM直接改写药物开发路线——池越大越要往合成端打。共同教训是表达量数据的价值不在数字本身而在你知不知道怎么解读它的缺口——评估靶点前必须问三个问题数据库采了哪些组织mRNA 到蛋白的换算里半衰期和周转是什么角色个体差异有多大2025 年 1 月Vertex 的 suzetrigine 获 FDA 批准成为几十年来第一个全新机制的口服镇痛药。它靶向 Nav1.8一个有趣的事实是如果你打开最权威的人体组织表达数据库查这个靶点它几乎在所有 51 个组织里都显示Not detected——转录本低到检测仪器的下限以下。一个数据库里不存在的靶点为什么能成为三十年来镇痛领域最大的胜利答案藏在表达量数据的两个经典陷阱里。这篇文章讲两个真实案例Nav1.8 教会我怀疑数据库的采样盲区Lp(a) 教会我别信 TPM 要信摩尔池。它们共同的教训是——靶点表达量不是查出来的一个数字而是数据源覆盖度、转录-蛋白换算、个体差异三层修正后的判断。先弄明白 TPM一个份额不是浓度两个案例都会反复用到 TPM 这个单位值得先花一分钟把它看透。TPM Transcripts Per Million每百万转录本数。测序仪测出来的原始数据其实只是比对到某基因的 reads 条数这个计数被两个因素污染测序深度同一库跑 5000 万 reads 和 1 亿 reads所有基因计数差一倍和基因长度同样丰度下3000 bp 基因捕获的 reads 天然是 300 bp 基因的 10 倍。TPM 就是洗掉这两个污染后的标准归一化先把 reads 数除以基因长度再归一化成每百万总转录本中的份额。打个比方奶茶店今天共卖出 100 万杯饮品全细胞转录本珍珠奶茶卖了 5000 杯它的 TPM 就是 5000——占 0.5% 市场份额。但要注意杯其实大小不等得先把销量换算成标准杯再算份额不然大杯装天然显得卖得多这就是第一步除基因长度干的事。主流数据库选 TPM 而不是老前辈 FPKM原因很实际TPM 让每个样本的总和恒等于 100 万跨样本、跨基因都能直接比FPKM 的总和因样本而异跨样本比较会误导。GTEx、HPA 全用 TPMHPA 页面里的 nTPM/nCPM 则是在 TPM 上再加一层样本间归一化去批次效应。量级锚点感受一下GTEx 里肝脏 ALB白蛋白TPM 可达数万而 SCN10A 在 HPA 全库 51 个组织的最高值只有 0.1 nTPM——份额差五六个数量级。粗略换算一个哺乳动物细胞总 mRNA 约 10⁵–10⁶ 个分子所以 1 TPM ≈ 0.1–1 个 mRNA 分子/细胞。但 TPM 天生带着三个坑正好预告了后面两个案例它是份额不是浓度——同样的 TPM在转录组总量不同的细胞里对应不同绝对拷贝数它是相对值会互相挤占——红细胞里 HBB血红蛋白占转录组 30% 以上其他基因的 TPM 全被压缩它更是mRNA 不是蛋白——转录本丰度到蛋白浓度还隔着翻译效率和半衰期后面 Lp(a) 会用百倍差距现身说法。记住这三条再看表达量数据的眼光就不一样了。表达量的生理格局从高表达酶类到低表达通道先建立一个坐标系。人体里表达量最高的靶点是什么概念可溶性代谢酶和分泌蛋白典型量级 nmol/mg 蛋白级到血浆 μM–mM 级最低一档是离子通道和转录因子只有 10²–10⁴ 拷贝/细胞。拿两端最极端的对比——红细胞里的 CA II 约 20 μM折合每细胞 10⁶ 分子量级DRG 神经元里的 Nav1.7 只有几百个通道——差三到四个数量级药化含义完全不同。高表达靶点类型一览靶点类型典型表达水平代表靶点实例药化含义代谢酶可溶性nmol/mg 蛋白级细胞内 μM 级CA II碳酸酐酶 IIcarbonic anhydrase II红细胞 ~20 μM、CA I、ACE血管紧张素转换酶、HMG-CoA 还原酶他汀靶点药物史上最丰收的一类竞争性抑制剂只需对抗底物浓度药物代谢酶anti-target肝 CYP细胞色素 P450总量 0.5–1 nmol/mg 微粒体蛋白CYP3A4、CYP2D6、UGTUDP-葡萄糖醛酸转移酶不是靶点是雷区——DDI 研究对象蛋白酶消化道/中性粒细胞高丰度胰蛋白酶、弹性蛋白酶、凝血瀑布纤维蛋白原 ~9 μM 血浆、DPP-4西格列汀靶点经典可药靶点口服小分子成功率高细胞骨架/结构蛋白占可溶性蛋白百分之几β-tubulinβ-微管蛋白紫杉烷/长春碱靶点、actin肌动蛋白血小板中 ~10⁶ 拷贝/细胞、血红蛋白化疗药 collateral toxicity 的来源血清分泌蛋白血浆 μM–mM 级白蛋白~600 μM、IgG免疫球蛋白 G~65 μM、TTR转甲状腺素蛋白~4 μMtafamidis 靶点、PCSK9~2 nM化学计量式耗竭需大剂量siRNA/抗体占优受体酪氨酸激酶高表达档肝细胞 15–30 万拷贝/细胞胰岛素受体大鼠脂肪细胞 ~10 万/细胞BioNumbers 101361、EGFR肝细胞 15–30 万RTK 也有高表达档信号放大级联下 10% 占位即可显效离子通道的例外NMJ神经肌肉接头处 nAChR 密度 10⁴–10⁵/μm²小鼠终板总量 ~3×10⁷ 受体/终板nAChR尼古丁型乙酰胆碱受体nicotinic acetylcholine receptor肌松药靶点、RyR11 型兰尼碱受体ryanodine receptor 1恶性高热靶点离子通道整体低表达但这两个解剖学位点局部极高感光 GPCR 例外视杆细胞外节 ~3–5 mM视紫红质rhodopsin人体单蛋白浓度最高的 GPCRG 蛋白偶联受体视觉级联放大之源肿瘤过表达激酶扩增后 10⁵–10⁶ 拷贝/细胞A431 细胞 EGFR表皮生长因子受体百万级、HER2人表皮生长因子受体 2扩增乳腺癌正常乳腺上皮 1 万肿瘤扩增 100 倍以上、BCR-ABLCML 治疗靶点过表达本身是病理机制选择性靠正常组织表达差补体系统血浆 μM 级级联蛋白C5eculizumab/依库珠单抗靶点抗体药成功但剂量需求大pool 太大低表达靶点类型一览靶点类型典型表达水平代表靶点实例药化含义离子通道10²–10⁴ 拷贝/细胞膜靶点最低档Nav1.7电压门控钠通道 1.7SCN9ADRG 神经元几百拷贝、Kv1.5电压门控钾通道、hERGhuman ether-à-go-go 相关基因心脏安全 anti-target需 pM–nM 亲和力过表达 assay 与 native 药理偏差大转录因子10³–10⁵ 分子/细胞p53肿瘤抑制因子细胞系实测 2.1×10⁴–1.96×10⁵ 分子/细胞正常细胞更低且被 MDM2 泛素化降解维持、MYC原癌基因转录因子正常成纤维细胞峰值 3–6 千分子/细胞、STAT3信号转导与转录激活因子 3低丰度 不可成药双重困难传统小分子禁区细胞因子受体10²–10³ 拷贝/细胞IL-2Rα白介素 2 受体 α 链长臂猿实测 150 拷贝/细胞BioNumbers 109885、IFNAR干扰素受体小分子极难覆盖基本是生物药地盘孤儿/低丰度 GPCR0.01–1 pmol/mg血小板蛋白质组实测 α2A 肾上腺素受体仅 140±60 拷贝/血小板大量 GPRxx 孤儿受体约 120–130 个非化学感应孤儿 GPCR 配体未知放射配体结合实验都难做配体未知更无从筛部分非受体激酶NRTKnon-receptor tyrosine kinase非受体酪氨酸激酶数百–数千拷贝/细胞JAK1/2/3Janus 激酶 1/2/3TYK2 亦是JAK3 主要在造血细胞JAK1/2/TYK2 广泛表达但拷贝低、SYK脾酪氨酸激酶、BTK布鲁顿酪氨酸激酶B 细胞、ZAP70ζ 链相关蛋白激酶 70kDaT 细胞U2OS 细胞系绝对定量蛋白质组Mol Syst Biol 2011显示激酶整体落在低–极低丰度档500–5000 与 500 拷贝/细胞血小板蛋白质组实测 Akt1丝苏氨酸激酶500 拷贝、FynSrc 家族酪氨酸激酶3400 拷贝/细胞——蛋白组学常在检测限附近但催化级联下低拷贝不等于低药效选择性抑制剂 10–30% 占位即可切断通路这就是 JAK/BTK/SYK 抑制剂能成为口服小分子重镇的原因孤儿核受体低–中多数 NR核受体亚型部分成员表达局限在特定组织肿瘤新抗原/突变蛋白极低且仅肿瘤组织p53 突变体、KRAS G12DKRAS 基因甘氨酸 12 位突变为天冬氨酸表达低但选择性极好靶向性的来源激酶是个特殊的分裂带值得单独看一眼。经典药化教材把激酶笼统归为中低表达但定量蛋白质组揭示的是分裂图景受体型激酶RTK靠基因扩增能上到 10⁵–10⁶见高表达表 EGFR/HER2胞质内的非受体激酶却被压在数百到数千拷贝的窄带里。这带来三个实际后果生化 assay 的酶量要精打细算10 nM 酶与 500 拷贝/细胞的生理浓度差 1–2 个数量级体外 IC50 到细胞里经常变弱选择性窗口没有表达量红利可挥霍只能靠家族保守 ATP 口袋的细微差别降解剂PROTAC反而受益——催化式降解不需要化学计量覆盖几百拷贝的靶点一个降解剂分子就能循环清除E3 泛素连接酶底物受体 CRBNcereblon配体家族的成功部分源于此。这个格局为什么重要高表达靶点常有受体储备receptor reserve10–30% 占位即可显效生化实验好做、共晶好长低表达靶点没有储备需要 90% 以上占位、游离药物浓度冲到 Kd 的 10 倍以上且过表达 assay 会扭曲真实药理——Nav1.7 镇痛药三十年临床失败靶占位压不上去是公认主因之一。高表达也有代价靶点本身成为药物清除途径TMDD还会带来镜像 on-target 毒性CA 抑制剂压住红细胞 CA 导致代谢性酸中毒就是典型。陷阱一数据库里没有的组织靶点可能在那里高表达回到 Nav1.8。为了验证数据库里的Not detected我从 Ensembl 解析出 SCN9ANav1.7和 SCN10ANav1.8的 ENSG ID去 Human Protein Atlas 拉全量数据——HPA 的 consensus 数据集本身就是 HPA GTEx 合并的 51 组织转录组一次查询等于看了两个权威库。指标SCN9A / Nav1.7SCN10A / Nav1.8HPA 分类Tissue enhanced (Brain)Not detected全库最高组织下丘脑 5.7 nTPM睾丸 0.1 nTPM脑区下丘脑 5.7、中脑 1.2、脊髓 0.6全部 0.0单细胞最高Sertoli 810 / OPC 300 / 神经元大类 286 nCPMLate spermatids 4.6 nCPM如果只看这张表你会得出Nav1.8 在人体几乎不表达别碰的结论——而这恰恰是错的。真相是GTEx 和 HPA 都不采集 DRG背根神经节而 DRG 恰恰是伤害性感受神经元的胞体所在、这两个通道的主表达地。文献里人 DRG 单细胞测序显示Nav1.8 是 nociceptor 中最丰富的 α 亚基之一TPM 数百级Nav1.7 广泛表达但量级低于 Nav1.8。GTEx 的 Nerve-Tibial 也救不了场胫神经是远端神经干胞体在 DRG神经干里 SCN10A 转录本本就趋零。临床结局反过来验证了这一点。投入更早更重的 Nav1.7 赛道至今没有成药而 Nav1.8 的 suzetrigine 成了三十年来首个新型口服镇痛药。Nav1.8公共库不可见 真实组织 DRG 特异的组合反而是它组织选择性的来源——药物打在 DRG nociceptor 上心脏、平滑肌、骨骼肌里的 Nav 同族亚型几乎不接触安全性天然好。这个陷阱的普遍规律值得记住公共库查不到 ≠ 不表达。神经、肠神经系统、肌肉深部、关节软骨、视网膜等采样薄弱的组织靶点的真实表达必须用文献单细胞数据补。评估报告里应该显式写一节数据源覆盖缺口——哪些组织数据库没有采、这些组织对靶点是否关键。陷阱二TPM 打平的两个靶点血浆池能差百倍第二个案例是一对看似平起平坐的肝源分泌蛋白PCSK9 和 Lp(a)。两者都是肝细胞合成的血浆蛋白Lp(a) 的蛋白本体 apo(a) 由 LPA 基因编码。同样从 HPA 拉数据维度PCSK9LPA (apo(a))肝 nTPM47.571.8仅 1.5 倍肝外信号小脑 10.3、肺 7.448/51 组织 1近乎肝专属肝细胞单细胞 nCPM21.982.0HPA 血浆浓度免疫法143 ng/mL78.8 μg/mL换算摩尔浓度约 2–2.6 nM约 30–80 nM高表达人群可达 250 nM个体差异3–5 倍超过 100 倍0–250 nmol/LmRNA 层面几乎打平——LPA 只比 PCSK9 高 1.5 倍。但分泌速率、蛋白半衰期游离 PCSK9 周转快Lp(a) 颗粒清除极慢和遗传调控LPA 的 Kringle IV-2 重复拷贝数多态把血浆池拉开了两个数量级。池的大小直接改写药物的开发路线。PCSK9 约 2 nM 的小池单抗化学计量中和完全可行——evolocumab、alirocumab 都已上市siRNA 敲合成端的 inclisiran 也成药三条路线通吃。Lp(a) 是 30–250 nM 的大池中和这么大的池子需要极高剂量抗体pelacarsen 80 mg/月Ph3 进行中敲合成端的 siRNAolpasiran、zerlasiran天然占优——池越大越要往合成端打。小分子的机会同样在 Lp(a)muvalaplin 不做中和而是口服小分子阻断 apo(a) 与 apoB 的组装绕开大池难题。大 pool 血浆蛋白的小分子策略 阻断组装/分泌不是中和存量。这里还藏着一个检测陷阱。HPA 数据里 LPA 免疫法 78.8 μg/mL vs 质谱 12 μg/mL相差 6.5 倍。这是 Lp(a) 领域经典的异构体偏倚——抗体表位在 Kringle IV 重复区大异构体表位多、免疫法系统性高估。临床 Lp(a) 检测必须用 isoform-independent 方法否则跨研究数据不可比。两个陷阱的共同教训Nav1.8 和 Lp(a) 看似是两个独立的故事其实是同一堂课的两个侧面表达量数据的价值不在数字本身而在你知不知道怎么解读它的缺口。数据库告诉你 Nav1.8 “Not detected”它没告诉你的是采样框里没有 DRG数据库告诉你 PCSK9 和 LPA 的肝 TPM 只差 1.5 倍它没告诉你的是半衰期和遗传多态会把血浆池拉开百倍。靶点评估的第一步不是查数字而是问三个问题这个库采了哪些组织mRNA 到蛋白的换算里半衰期和周转是什么角色个体差异有多大——回答了这三个表达量这个数字才真正有意义。参考来源Human Protein Atlas: https://www.proteinatlas.orgSCN9A/SCN10A/PCSK9/LPA 表达数据2026-08 查询Ensembl REST API: https://rest.ensembl.orgENSG ID 解析U2OS 绝对定量蛋白质组Nagaraj N, et al. Mol Syst Biol 7:512 (2011), doi:10.1038/msb.2011.82血小板全谱拷贝数Zeiler M, et al. Mol Cell Proteomics 13:3366 (2014)Akt1 500、Fyn 3400 拷贝p53 拷贝数Ma L, et al. PNAS 102:14266 (2005)PMID 16186499MYC 拷贝数Waters CM, et al. (1991)转引自 Genes Dev 17:1115 (2003)suzetrigine FDA 批准信息Vertex Pharmaceuticals, 2025-01Lp(a) 临床阈值125 nmol/L约 50 mg/dL为心血管风险增强因子阈值
返回列表