十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

生物药FTO检索中序列比对的完整逻辑与实操要点

生物药FTO检索中序列比对的完整逻辑与实操要点 做生物药研发的朋友大概率都遇到过这样的时刻拿到一个候选抗体序列或者准备立项一个生物类似药脑子里第一反应就是——先查一下这个序列会不会踩到别人的专利。于是打开NCBI把序列丢进BLAST看着一堆相似度80%、70%的结果心里越来越慌但真要问“到底侵权不侵权”又说不清楚。这个场景我太熟悉了因为我自己在生物药项目里做FTO检索时就是从这种“知其然不知其所以然”的状态开始的。生物药的FTOFreedom to Operate自由实施检索本质上是个把法律问题翻译成生物学问题、再翻译回法律判断的过程。它和小分子药物的FTO完全不同小分子可以按CAS号、母核结构、Markush通式去查而生物药的核心是一串氨基酸序列。序列比对就成了整个FTO检索的第一道关口但又远不止“比一下相似度”这么简单。这篇文章我想把生物药FTO检索中关于序列比对的完整逻辑、操作流程和容易翻车的细节讲清楚适合研发岗、IP岗和做立项调研的同行参考。1. 为什么生物药的FTO检索要先解决序列比对问题1.1 序列既是生物药的核心资产也是专利布局的靶心传统化学药的专利保护重点在化合物结构本身查起来是“结构式检索”的逻辑。而生物药不一样一个抗体、一个融合蛋白、一个细胞因子它的全部信息都浓缩在一级氨基酸序列里。序列定义了分子身份决定了功能也决定了它在专利法上被如何描述和界定。你去读生物药的专利权利要求书会发现大量这样的表述“一种分离的抗体包含具有SEQ ID NO: 1所示氨基酸序列的重链可变区”或“一种与SEQ ID NO: 2具有至少90%序列同一性的蛋白”。这些写法意味着权利要求的核心边界是序列而不是结构式。所以FTO检索的第一步必须用序列比对去探测目标专利的存在和边界。这里有个很关键的背景生物药的专利布局往往不是一条序列一个专利而是“海陆空”立体覆盖。核心序列专利只是最底下那一层上面还有表达载体、宿主细胞、纯化工艺、制剂处方、医药用途等一大堆外围专利。序列比对解决的恰恰是最核心、也最致命的那一层——你的分子本身是不是落入了别人的序列权利要求范围。如果这一层都没过关后面工艺、制剂做得再好产品也上不了市。1.2 序列比对是起点但“相似度”不等于“侵权结论”我遇到过不少研发同事拿着BLAST结果直接下判断“这个序列跟XX专利的SEQ ID NO: 5有92%相似度肯定侵权项目别做了。”这种判断方式太粗暴了既可能误杀好项目也可能漏掉真风险。专利侵权判断有自己的一套法律逻辑全面覆盖原则要求你的技术方案包含了权利要求记载的全部技术特征才算字面侵权如果没完全覆盖还要看是否构成等同侵权即用基本相同的手段、实现基本相同的功能、达到基本相同的效果且是本领域技术人员容易想到的替换。这放在序列类权利要求里就出现了一个很有意思的局面同一性百分比高不一定侵权同一性百分比低也不一定安全。一切要回到权利要求的撰写方式、功能限定和审查历史里去判断。所以序列比对在FTO里的正确定位是它是把海量专利数据缩小到少数“候选风险专利”的过滤工具是risk assessment的第一步而不是最后一步。这篇文章后面的内容都是围绕“拿到比对结果之后怎么往下走”来展开的。2. 专利权利要求在保护什么序列类权利要求的拆解与检索对象分析2.1 常见的序列类权利要求类型做FTO检索之前先要把生物药专利中可能出现的序列类权利要求摸透否则比对了半天都不知道自己是在比对哪些保护对象。按我的经验常见的可以分成四类蛋白/多肽序列权利要求保护的是“分离的蛋白”通常以SEQ ID NO定义写法上有“由SEQ ID NO: X组成”consisting of和“包含SEQ ID NO: X”comprising两种。后者覆盖范围明显更大只要你的序列里包含这段序列就可能落入。变体/同源物权利要求写法通常是“与SEQ ID NO: X具有至少80%/85%/90%/95%序列同一性且具有XX活性的蛋白”。这类权利要求的核心是“同一个性下限功能限定”比对时既要比对序列也要核对功能特征是否被覆盖。抗体类权利要求这是最复杂的。常见写法包括“包含HCDR1-3和LCDR1-3的抗体”、“包含SEQ ID NO: X重链可变区的抗体”、“以XX亲和力结合抗原XX的抗体”。有些授权专利还会用“与参考抗体结合相同表位”这种功能性限定。核苷酸序列权利要求保护编码上述蛋白的多核苷酸、表达载体、宿主细胞等。做基因治疗、DNA疫苗、或者用特定表达载体生产蛋白时这一层尤其要留意。2.2 FTO检索中真正需要比对的几个序列片段明确了保护类型之后检索时就不能只拿“整条全长序列”去BLAST了得拆开、分段、多角度比对。我的做法是把候选分子的序列拆成几个层次分别检索、分别建档全长氨基酸序列用于定位同源家族、识别最接近的风险专利。第一次宽筛时全长序列是主力。功能区域序列比如抗体的CDR区、融合蛋白的活性域、受体的配体结合域。很多时候全长序列同一性不高但CDR区或关键活性域高度保守这可能触发等同侵权判断。可变区/成熟肽序列如果是抗体轻重链可变区VH/VL是核心如果是分泌蛋白要去掉信号肽用成熟肽序列比因为专利里保护的多半是成熟形式。编码核苷酸序列如果项目涉及表达载体、mRNA药物、DNA疫苗核苷酸层面的比对不能省。把这些序列拆好并分别记录后再看BLAST结果时心里就有数了某一篇文章里的专利序列在哪个段位上和你重叠重叠的区域是不是功能关键区对应的权利要求写法是哪一种。这种信息粒度比“整体相似度90%”有价值得多。2.3 一个容易踩的坑全长序列“同源性高”与“落入权利要求”是两回事实际操作中我见过最典型的误判是一条候选序列跟某个专利里的全长序列有85%的同一性看起来好危险但如果专利权利要求写的是“包含SEQ ID NO: X所示的CDR区”注意只保护CDR序列本身而你的CDR恰好完全不一样全长同一性高只是因为框架区FR保守那侵权风险反而很低。反过来你的全长序列跟专利序列只有70%同一性但HCDR3完全一样而这个专利的权利要求恰恰是“包含与SEQ ID NO: X相同的HCDR3”那就不能因为全长同一性低就判定安全。这也解释了为什么我一直强调“拆段比对权利要求解读”要联动进行。比对的粒度越细越能避免被全长相似度带着走。3. 从NCBI到专业数据库免费工具与商用工具的配合打法3.1 免费工具能解决什么开源和免费的检索工具足够完成FTO的初筛阶段甚至能覆盖相当大比例的场景。日常我用的最多的是这几个NCBI BLASTblastp/blastn这是最基础的序列比对工具。FTO场景下数据库可以直接选择“patented proteins”或“patented sequences”它会去检索各国已公开专利中的序列表。第一次宽筛时我一般会同时用nr库和patent库各跑一遍原因后面细说。Google Patents不能直接做序列比对但拿到专利号之后在Google Patents里查全文非常方便PDF下载、同族信息、法律状态入口都有。EspacenetEPO看欧洲专利的同族、法律状态、权利要求多语言对照比较顺手。UniProt辅助看蛋白功能注释、结构域划分帮助判断比对结果的生物学意义。NCBI的patent库有个好处结果里会直接给你专利公开号这样就能顺藤摸瓜去查权利要求全文。但也有个明显的坑——patent库的结果漏检率不低因为专利序列表的录入质量、格式差异、更新延迟都会影响命中率。所以我通常的态度是免费工具命中了的专利号要认真查没命中不代表没有只能说明“在这个库里没有明显的同源序列”。3.2 商用数据库补的是哪块短板预算允许的公司我建议至少买一个商用序列检索数据库。目前市面上主流的选择包括GenomeQuest、QuestelQuestel Sequence、DerwentClarivate等。我们项目里用的是GenomeQuest它相比免费工具的优势主要体现在几个方面专利序列表收录更全商业库会对各国专利局公开的序列表做深度加工整合覆盖面远大于NCBI的patent库。同一性族identity family分析自动把相似度超过阈值的专利序列聚成族直观看出哪些专利共享一段核心序列这对判断专利丛林很有帮助。批量法律状态对接比对结果可以直接关联到专利的法律状态、到期日、同族信息省掉了大量手工查询。参数可定制可以设置同一性阈值、覆盖度要求、数据库范围指定国家、指定年份等。不过说实话商用数据库的价值在于“省时间、省人力、降低漏检率”不在于“替代人工判断”。最终的风险结论还是要靠人来读权利要求、判等同、做地域分析。3.3 BLAST实操中的参数与筛选经验分享几个我跑BLAST时的具体做法供第一次做FTO检索的同行参考第一次宽筛阈值不要卡太高把同一性筛选阈值放到50%以下甚至30%-40%也值得扫一眼。因为某些权利要求的同一性下限可能只有60%-70%加上等同比对中低相似度的结果也有价值。宽筛的目的是“宁可多看不可漏掉”。低复杂度过滤要灵活NCBI BLAST默认会做低复杂度区域过滤SEG这能减少信号肽、重复序列带来的噪声但也可能把短但关键的基序过滤掉。我的做法是默认过滤跑一遍、关闭过滤再跑一遍两套结果对照着看。覆盖度query coverage要关注有些结果同一性很高但只覆盖你序列的一小段这种往往是某个结构域或某段重复序列的对应不一定构成整体风险但需要单独记录并判断。反过来覆盖度高但同一性中等的结果往往更值得深挖。记录检索参数FTO报告里必须包含检索日期、数据库版本、BLAST程序版本、参数设置、检出的专利号清单。这不是形式主义而是将来如果产品要上市、要融资、要做尽调这些记录就是证据链。我一般会在项目文件夹里留一个“FTO_检索记录_日期”的文档把每次检索的输入序列、参数、结果摘要保存下来。4. 同源不等于等同比对结果如何落到侵权判断上4.1 序列同一性没有“绝对安全线”这是整个FTO里最容易让人焦虑、也最容易出错的地方。很多人想找一个“同一性低于多少就不侵权”的量化标准但很遗憾不存在这样的标准。如果专利权利要求写的是“与SEQ ID NO: 5具有至少90%同一性的蛋白”那么你的序列同一性是85%理论上不在字面范围内。但接下来要问85%的差异集中在哪些位置如果差异都在非关键区域而关键活性位点、功能域的序列高度保守对方完全可以主张等同侵权——你用了基本相同的手段实现了相同的功能达到了相同的效果而且这种保守替换是本领域技术人员容易想到的。反过来如果权利要求写的是“由SEQ ID NO: 5组成的蛋白”那么哪怕你的序列是99%同一性只要不是100%一致都不构成字面侵权因为“consisting of”是封闭式表达不覆盖有差异的变体。但如果你的变体保留了全部核心功能等同侵权还是有被主张的空间。所以我在做FTO结论时会把同一性结果分成三档来对待风险档位判读依据行动建议高风险同一性高于权利要求下限或覆盖了封闭式权利要求的全部序列CDR区/活性域高度保守立即做逐项权利要求比对启动规避设计或无效证据收集中风险同一性低于下限但高于60%或部分功能区域保守存在功能性限定竞合可能深入分析差异位点的功能影响必要时做体外活性对比实验作为抗辩证据低风险同一性低于50%且权利要求中的核心区域未被覆盖无功能性限定覆盖保留检索记录纳入常规监控即可4.2 全面覆盖原则在序列权利要求中的应用细看侵权判断绕不开全面覆盖原则。放到序列类权利要求里我理解它的应用方式是把权利要求的每一项技术特征拆出来逐一比对。比如一个抗体权利要求可能包含“重链可变区SEQ ID NO: 1”和“轻链可变区SEQ ID NO: 2”两个特征如果你的重链与SEQ ID NO: 1同一性只有80%但轻链与SEQ ID NO: 2完全一致那并没有覆盖全部特征字面侵权不成立。但另一个角度是“包含”comprising式权利要求只要覆盖了其中一个必要特征同时其他特征等同仍可能被认定侵权。这里最棘手的是功能性限定。现代抗体专利越来越倾向于写“结合人PD-1且不竞争结合XX抗体的抗体”或“以10nM以下亲和力结合XX抗原的抗体”。这类权利要求里序列比对只是一个侧面更强的判断证据是实验数据——你得证明你的抗体在功能上是否与权利要求定义的范围重叠。这也是为什么我一直建议FTO评估要有分子生物学家参与不能只靠IP人员对着序列硬比。4.3 不同阶段的风险容忍度不一样做FTO不是一锤子买卖同一份比对结果在研发不同阶段处理力度完全不同立项调研阶段只需要判断是否有直接命中核心序列的专利。如果明显落入高风险区可以尽早调整分子设计如果只是中风险可以先立项后面再做详细分析。IND申报前这时候要动真格了需要对候选序列做完整FTO分析包括序列比对、权利要求逐项解读、法律状态核实、地域过滤。因为一旦启动临床后续投入巨大风险要提前暴露。上市申报前除了序列专利还要把工艺、制剂、用途专利纳入FTO范围同时评估专利链接制度下的仿制药/生物类似药挑战程序。这时候如果发现还有高风险专利需要启动规避设计、许可谈判或无效准备。5. 一个单抗序列的FTO走查实录从输入序列到风险结论输出5.1 场景设定与序列预处理拿一个虚拟案例来走一遍完整流程。假设我们要做一个抗PD-1的人源化IgG1单抗候选分子已经确定了重链和轻链全长序列计划在中国和美国申报临床。拿到序列后的第一件事不是BLAST而是先做序列预处理用Kabat或IMGT编号规则确定CDR区边界标注HCDR1-3和LCDR1-3预测信号肽切割位点去掉信号肽得到成熟肽序列整理出三份比对外包全长重链成熟肽、全长轻链成熟肽、六个CDR的单独序列。做完预处理我习惯在项目记录里先写一版“序列信息卡”列清楚序列来源、修饰情况比如有没有Fc突变、去岩藻糖等糖基化修饰、CDR定义规则。这版卡片后续会跟着FTO报告一起存档。5.2 检索执行与候选专利确认接下来正式跑BLAST。我通常会在patented proteins库和nr库各跑一次blastp数据库默认参数但关闭了低复杂度过滤再增跑一遍。假设结果是patented库里有两条看起来相关的专利序列一条全长同一性88%覆盖度95%另一条全长同一性只有65%但覆盖率接近100%。Google Patents里查这两条序列对应的专利读出关键信息专利A的权利要求1写的是“一种分离的抗体包含与SEQ ID NO: 6具有至少95%同一性的重链可变区”。我们的VH与SEQ ID NO: 6的同一性比对后发现只有82%低于95%所以字面不落入该权利要求。但接下来要追专利A里还有没有从属权利要求把同一性下限拉低到80%有没有“包含HCDR1-3为SEQ ID NO: 7-9”的权利要求如果有CDR区域的比对就变成风险判断的关键。专利B的权利要求相对窄写的是“一种分离的单克隆抗体由轻链SEQ ID NO: 10和重链SEQ ID NO: 11组成”这是封闭式写法。我们的序列和它有65%的同一性远不构成字面覆盖但因为覆盖度很高需要进一步看差异集中在哪里。把多序列比对结果打开如果发现差异大部分集中在框架区而CDR区高度保守那就有等同侵权的隐患需要重点评估。5.3 法律状态过滤与结论输出法律状态过滤是整个流程里最务实的一步。在Espacenet和Google Patents上检查专利A和专利B在中国的同族是否有效、美国同族是否有效、预计到期日是哪天。假设专利A在目标国家已经因为未缴费而失效那风险直接清除连等同分析都不用做了。专利B在目标国家还在有效期内就要继续分析。最终的FTO结论我会按“风险点列表”的方式输出每一条包含专利公开号、同族信息、法律状态命中序列与权利要求的对应关系字面侵权/等同侵权的判断依据风险等级高/中/低下一步行动建议如设计点突变避开特定CDR、启动公众意见程序、收集在先技术准备无效请求、或联系权利人谈许可。这个流程写完看起来逻辑清晰但我必须坦诚地说真正执行的时候大概率会碰到各种意外比如BLAST结果里蹦出一个十年前的非专利常规序列数据库条目或者某个专利的权利要求写得很绕读三遍都拿不准它到底保护什么。这些情况下我的经验是宁可把风险等级调高一档也不要为了项目进度“强行定低风险”。FTO的失误代价是上市后的侵权诉讼风险判断的保守倾向是合理的。6. 检索报告之外那些容易翻车的边界问题6.1 专利簇和改构专利绕过一件专利不等于安全做FTO忌讳的是把视野局限在“最接近的那一件核心专利”。生物药领域有一个很典型的现象原研公司在核心序列专利之外会围绕改构体、优化变体、特定修饰形式申请大量“卫星专利”。你可能精心设计了一套CDR序列绕开了原始专利的权利要求结果却恰好落进了同一家公司后来申请的“优化变体”权利要求范围。这类改构专利的权利要求往往就写在序列同一性区间里比如“与SEQ ID NO: 14具有至少85%同一性且包含Fc区YTE突变的抗体”。如果你的候选分子正好用了YTE突变来提高半衰期那即使CDR序列完全不同也可能因为Fc修饰特征而落入另一件专利。所以序列比对时把Fc区修饰、突变位点、糖基化特征拆分出来单独比对是非常值得做的动作。6.2 Bolar例外和专利链接制度搞清时间边界生物类似药和仿制药的FTO里“什么时候能开始做”和“什么时候能上市”是两个完全不同的问题。按照相关法律规定为了提供行政审批所需信息而制造、使用、进口专利药品或专利医疗器械的不视为侵犯专利权这就是俗称的Bolar例外。它保障的是“注册申报前的研究行为”但绝不意味着可以提前商业化生产。中国的药品专利链接制度则是另一个维度的问题它把仿制药/生物类似药的专利挑战时间前置到了注册审批阶段。如果一款生物类似药的目标产品在中国有登记的相关专利申报时就要做专利声明或者作出不落入相关专利保护的说明。这些程序性要求都需要FTO检索的结果作为支撑证据。6.3 工艺、制剂和用途专利序列不是全部我发现很多研发人员做FTO时眼里只有序列但对生物药的工艺专利、制剂专利、用途专利关注严重不足。一个生物药从基因到成品药中间有宿主细胞构建、细胞培养、纯化、制剂冻干等无数技术环节每个环节都可能被专利覆盖。举一个我实际遇到的例子某个单抗项目的序列FTO完全干净但生产用的CHO宿主细胞系正好在一件美国专利的覆盖范围内而那个专利要求了“特定CHO细胞系用于生产糖基化蛋白”的权利。为了绕过这件专利我们被迫更换宿主细胞整个工艺验证推倒重来。如果你的产品要在美国上市这一类的工艺/细胞株/培养基专利千万不能忽略。6.4 内部协同FTO最好是跨职能团队作战最后我想说的是生物药FTO检索不是一个人能独立完成的活。序列比对可以由专利分析师或生信人员执行权利要求解读需要专利代理师或律师的深度参与而“这个差异位点会不会影响功能、是否能作为规避设计方向”的判断必须有分子生物学家背书的。我们项目里的标准配置是“IP负责人专利代理师首席科学家”三个人一起过风险清单缺一不可。实操中还有个小技巧每次FTO评估做完把结论同步给研发负责人和项目管理让序列设计和专利风险形成闭环。比如某个CDR区域保守导致高风险研发那边就可以在下一轮分子优化时做定点替换然后拿新序列回来做第二轮比对。这种“设计-检索-再设计”的循环做上两三轮比到最后拿着一个成熟序列再做一次性FTO要高效得多。我自己在生物药FTO上踩过的坑最典型的就是早期迷信全长序列BLAST的同一性数字。后来次数多了才明白序列比对真正的价值不在那个百分比里而在于它逼着你去拆解权利要求、理解专利边界、判断功能覆盖。把序列比对放对位置它就是一个出色的风险过滤器放错位置它只能制造焦虑或虚假的安全感。希望这篇文章能帮你把FTO里“序列比对”这一关走扎实。
返回列表