1. 从序列到产物,一个可审计的闭环
Evolrix AI 是 AI 驱动的生物制造平台——更准确地说,是一个 AI 原生的 DBTL(Design–Build–Test–Learn)闭环[8]。长期愿景是让 Kairos——其上的 AI 科学家 agent——协调全链:序列设计、表达优化、发酵、纯化。当前已交付的是干实验设计这一半:序列设计、表达构建优化与结构置信度检查;而发酵、放大与纯化在路线图上,经由湿实验伙伴与主动学习闭环实现。每一步都可溯源至其证据。平台逐宿主构建。毕赤酵母先行,其产物已获 FDA 批准(Kalbitor、Jetrea、Semglee);多宿主为演进愿景。每项能力都基于带引用的证据,并与模型预测分开,使得「已知的」「推断的」「设计的」三者始终可被检视。
所谓可审计的闭环,我们指的是具体的东西,而非口号。平台产出的每一个产物——一条设计的序列、一个推荐的构建体、一个结构预测、一个发酵参数——都携带其完整来源链:原始用户查询、被调用的工具、传给每个工具的参数、检索到的文献与专利,以及把它们串联起来的推理路径。审阅者可以重新打开任一产物,一路回溯到确切的来源记录和模型给出的置信度。闭环中没有任何东西脱离证据链而存在;测量的标注为测量,预测的标注为预测。
DBTL 框架不是借来的装饰——它点明 Evolrix AI 把重量放在哪里。多数 DBTL 平台的加速点是 Build/Test 的自动化硬件(foundry);Evolrix AI 的加速点是 Design 与 Learn 两相,用 AI + 可验证工具 + 独有的专利/中文数据,把毕赤表达里最「体力活、靠经验」的「选构建体/选工艺」环节变成数据驱动、可审计的推荐[8]。
平台立于三根数据支柱之上,每一根在闭环中扮演不同角色:
| 支柱 | 是什么 | 在闭环中的角色 |
|---|---|---|
| 机理知识 | 66k 全文语料(1,950 篇毕赤聚焦)蒸馏为知识图谱 | 每次查询的检索与接地 |
| 结构 | Boltz-2 结构验证 | 预测结构置信度筛查——在构建前标记低置信或结构可疑的候选(计算内筛查,非实验验证) |
| 动态表达 | Host-engineering 数据集,~627 条 regulatory 记录、21 个跨源 fold | 学习构建体效应以优化表达 |
这一定位并非抽象。它落在一场已硬化为各国国家政策的全球技术竞赛中——而这场竞赛的决胜杠杆,几乎被每个国家战略不约而同地点名,正是 Evolrix AI 所选择的那一条(见第 2 节)。
2. 为什么是现在:一场全球技术竞赛
现在就为一个 AI 驱动的生物制造平台下注,其理由不是某项单一突破,而是一次会聚:每个主要经济体都已不约而同地把合成生物学与生物制造提升为「国家战略乃至技术主权争夺」级别的优先事项,且几乎每个国家战略都点名同一套抓手——AI + DBTL + 数据 + 生物铸造厂(biofoundry)[14]。这不是背景色,而是 Evolrix AI 市场下面的需求曲线。
全球政策:一场技术主权竞赛
| 司法管辖区 | 举措 | 点名的内容 |
|---|---|---|
| 美国 | 第 14081 号行政令(2022)——国家生物技术与生物制造计划;《芯片与科学法案》;国防部 BioMADE 机构 | 全政府协同生物制造;「全球正处于由生物技术驱动的工业革命前夜」 |
| 英国 | 《工程生物学国家愿景》(2023)——五大关键技术之一,10 年投入 20 亿英镑 | 欧洲领先;预计 2030 年市场达 30 亿美元 |
| 欧盟 / 德国 | 2024 年 3 月出台加速生物技术与生物制造的政策;欧洲已有 12 国制定专门生物经济战略 | 加速生物制造基础 |
| 韩国 | 全球首部专门《合成生物学育成法》(2025 通过、2026 施行);定为国家战略技术 | 2030 年达美国 90% 技术水平;10 年内 30% 制造业转向生物制造;政府建公共 biofoundry |
| 日本 | 生物经济战略 | 100 万亿日元市场目标 |
经济体量:对制造业的数万亿美元级重塑
英国政府援引工程生物学在 2030–2040 年将产生每年 2–4 万亿美元的全球经济影响;有测算认为到本世纪末生物制造有望创造约 30 万亿美元价值,量级约为全球制造业的三分之一[14]。这就是合成生物学市场所在的宏观框架:US$19.75B(2025)→ US$56.48B(2031),CAGR 约 19%,AI 集成被明确列为核心增长驱动,亚太增速最快[10]。
中国:独特打法,以及 Evolrix AI 的落点
中国已把生物制造置于国家最高层级规划。《「十五五」规划纲要》(2026–2030)将生物制造列为前瞻布局的「六大未来产业」之一,推动其「成为新的经济增长点」——这一定位由二十届四中全会《关于制定十五五规划的建议》(2025)确立[9]。工信部正在编制《「十五五」生物制造发展规划》,明确呼唤「标志性产品和人工智能典型应用案例」、培育中试平台——Evolrix AI 直接契合这一政策优先方向[9]。规模是具体的:2025 年中国生物制造总规模约 1.1 万亿元(生物发酵产能占全球 70% 以上),预计 2030 年增至约 1.8 万亿元(约占全球 25%)[9]。
为什么 Evolrix AI 正落在政策杠杆所在之处
上述每个国家战略都点名同一组决胜杠杆——AI、DBTL、数据——作为把生物制造从「试错」推向「理性设计」的瓶颈。Evolrix AI 是一个 AI 原生的 DBTL 闭环[8]:Kairos 作为其 AI 科学家 agent,协调从序列设计到纯化的全链,每一步都可溯源至其证据。多数 DBTL 平台加速的是 Build/Test 的自动化硬件(foundry);Evolrix AI 加速的是 Design 与 Learn 两相,用 AI + 可验证工具 + 独有的专利/中文数据,把毕赤表达里最「体力活、靠经验」的「选构建体/选工艺」环节变成数据驱动、可审计的推荐。Evolrix AI 正押在这条精确的杠杆上——AI × DBTL × 数据——落在一个核心底盘生物(毕赤)之上,并带有一道独特的数据护城河。
3. 领域坐标
虚拟细胞大玩家无一做工业蛋白生产。毕赤 AI 碎片化:多数工具面向通用蛋白工程,缺乏工业宿主的聚焦。整个格局干净地分为三个阵营,Evolrix AI 占据第三个。
| 玩家 | 聚焦 | 定位 |
|---|---|---|
| Arc Institute / CZI / GenBio | 虚拟细胞 | 人/疾病细胞,药物发现 |
| Cradle / Basecamp | AI 蛋白工程 | 制药 + 化学品,多宿主 |
| Evolrix AI | 毕赤生物制造 | 重组蛋白全链生产,专利 + 中文数据护城河 |
AI 蛋白工程同类包括 Cradle 与 Basecamp。Evolrix AI 在两点上与之不同——毕赤宿主,其产物已获 FDA 批准且工业成熟;以及其数据护城河来自专利与中文文献,这是多数以英文为中心的工具所不挖掘的来源。第一点是宿主选择;第二点是数据通路选择。两者会复利叠加:一个聚焦毕赤、训练在他人看不见的来源上的平台,所学到的表达图景,与一个训练在英文文献上的通用蛋白工程工具不同。
上位赛道体量大且增长快。全球合成生物学市场2025 年约 US$197.5 亿,预计 2031 年达约 US$564.8 亿,CAGR 约 19%,AI 集成被明确列为核心增长驱动,亚太增速最快[10]。蛋白表达是这一大盘中的一个子集;Evolrix AI 的可服务细分是其中的「毕赤/酵母宿主 × 表达优化」切片。
4. 毕赤 = 产物获 FDA 批准的成熟宿主
毕赤并非实验性宿主。它是一个成熟的生产宿主,其重组产物包括获 FDA 批准的生物药,拥有深厚的工业与监管记录。它之所以成为主力宿主,原因在结构层面:作为真核生物,它能执行 E. coli 无法完成的翻译后修饰(二硫键、糖基化、折叠);它把异源蛋白分泌到培养液中,简化下游纯化;它在补料分批发酵中能长到极高的细胞密度(>100 g/L 干细胞重);并且它的糖基化可以被工程化——GlycoFi/GlycoSwitch 谱系人源化了 毕赤糖基化,为治疗性糖蛋白打开了通路[2]。这些特性正是 毕赤、而非长得更快的细菌,成为已批准生物药宿主的原因。
- >5,000 种重组蛋白已表达。[2]
- >70 个临床或上市产品。
- >300 个已授权工业化流程,>300 家生物技术/制药公司获授权使用该系统。
- 3 个 FDA 批准生物药,在已申报的 BLA 下生产。
已申报的 FDA BLA 包括:
| 产品 | BLA |
|---|---|
| Kalbitor | BLA 125277[1] |
| Jetrea | BLA 125422 |
| Semglee | BLA 761201 |
除已批准生物药外,毕赤表达的磷脂酶 C 持有 GRAS 地位,而植酸酶市场——一种由 毕赤生产的饲料酶主力——规模约 $3.5 亿[3]。植酸酶是一个有启发性的案例:它是一种热稳定的饲料酶,添加到禽畜饲料中以从植酸释放磷酸盐,而 毕赤 之所以是其主要生产宿主之一,正是因为它能在高滴度下分泌该酶,并完成该酶所需的富含二硫键的折叠。值得注意的是,无甲醇植酸酶生产已达 20 g/L,显示无甲醇路线今日已具备工业可行性。这就是 Evolrix AI 所构建的基础——不是一个我们希望它好用的宿主,而是一个其产物已在货架与饲料上的宿主。
5. 两个已验证能力
Evolrix AI 有两项已对数据验证的能力,而非仅仅是承诺。第一项已上线;第二项支撑表达优化层。
5a. 结构验证
平台使用 Boltz-2 预测并打分候选序列的结构。验证是一次受控对照:一条正确接地的野生型序列达到中位 pLDDT 0.93,而一条故意打乱(无接地)的同等组成基线崩塌至 0.48[4]。这个差距不是为营销挑选的 benchmark 数字——它是模型能自信折叠的序列与不能折叠的序列之间的差别。实践上,这意味着平台能在任何湿实验工作投入之前,就标记出结构支持不足的设计序列,且此事在公开的 /science/ 页面上即可完成。
| 序列 | 中位 pLDDT | 解读 |
|---|---|---|
| 野生型(接地) | 0.93 | 高置信折叠 |
| 打乱基线 | 0.48 | 模型无法解析折叠 |
5b. 表达构建体优化
第二项能力从 host-engineering 数据集中学习哪些构建体选择(启动子、分泌信号、伴侣共表达、发酵策略)能推动表达。数据集自 v0.1 起显著增长:现含 ~627 条 regulatory 记录,来自 83 个独立来源,覆盖 21 个跨源蛋白 fold[5]。这条能力服务两个目标:(A)证据引擎(主,稳健)——把专利/文献里「哪些构建体用过、报了多少表达量、带出处」结构化呈现供选择;(B)方向性排序(次,早期、诚实地弱)——对候选构建体按相对表达量排序。该领域的数据默认就是有噪声的——跨所有 fold,跨源构建体评分仅弱相关——这正是为何把一个实验室的构建体配方照搬到另一个实验室的蛋白上通常令人失望。Evolrix AI 对这一噪声的回应不是掩盖它,而是区分「可计算的部分」与「仍需湿实验的部分」,并在可计算轴上报告置信度。
最稳健的证据不受评估口径影响:模型恢复的元件效应吻合已知生物学。学到的启动子 pCS1 效应(+0.7,n=62)对应 Lonza 商用强启动子;伴侣 ERO1(氧化折叠)与 SBH1(信号肽加工)作为正贡献因子出现,与 毕赤 折叠和糖基化机理一致[5]。此证据是本能力最诚实的验证。跨蛋白泛化方法依赖,诚实报区间:去混淆的 within-source ρ≈0.12(保守诚实底线);含跨实验室尺度效应的跨源口径 ρ≈0.26;总体 ρ≈0.37(多数 fold 为单源,总体值受此主导)。在高置信 fold 上相关性高得多:xylanase 与 mannanase 的 titer 达 ρ 0.76–0.89。这些数字弱但为正——是真实的早期方向性信号,不是强预测器。通往预测器的路径需受控湿实验数据(同一蛋白、只变构建体、同条件测 titer),即路线图中的主动学习闭环。
| 构建体选择 / 指标 | 习得效应 | 依据 |
|---|---|---|
| 启动子 pCS1 | +0.7(正) | n=62 留一 |
| 伴侣 ERO1 | 正 | 从数据中恢复 |
| Within-source ρ(去混淆) | ≈0.12 | 保守底线 |
| 跨源 ρ(含实验室尺度) | ≈0.26 | 21 个跨源 fold,~627 条记录 |
| 高置信 fold(xylanase/mannanase) | ρ 0.76–0.89 | 跨源 titer |
实践上的含义是:与其把表达当作某个实验室需照搬的配方,平台量化每个构建体杠杆贡献多少,并告知用户置信度(ρ 与效应值),而非一个裸 titer 预测。平台区分问题的可计算部分(哪些构建体杠杆推动表达、推动多少,给定跨源数据)与仍需湿实验验证的部分(特定蛋白在特定实验室的绝对 titer),并对两者孰为孰坦率以告。其产物是构建体设计的方向性证据,而非 titer 的保证——这一区分本身,对任何需以可审计证据链来支撑一个构建决策的客户而言,恰恰是一项功能。
数据集与评估快照
这些数字的唯一真源是共享站点配置(site-truth.js);本节为可读性镜像。最后核验 2026-07-12。
| 指标 | 数值 | 说明 |
|---|---|---|
| 快照日期 | 2026-07-06 | host-eng 流水线 v0.4 |
| 记录总数 | 664 | 627 regulatory + 28 glyco + 23 lit + 9 seq |
| 跨源 fold | 共 24(regulatory-only cohort 21) | 这两个数字不矛盾——24 含 glyco/lit/seq fold;21 是用于主要 ρ 数字的 regulatory-only cohort |
| 来源 | 83 个独立来源 | 专利 + 文献 |
| 源内 ρ(去混淆) | ≈0.12 | 保守下界——跨蛋白构建体排序 |
| 跨源 ρ | ≈0.26 | 含实验室尺度效应 |
| 总体 ρ | ≈0.37 | 由单源 fold 主导 |
| 高置信 fold | ρ 0.76–0.89 | Xylanase / mannanase(较大样本) |
| 验证状态 | 早期方向性信号——非 titer 预测器。跨源噪声;小样本 fold(lipase、insulin)仍弱;绝对 titer 需湿实验。 | |
重要指标区分:首页的 host-fidelity ρ≈0.35 是另一个指标——它衡量的是蛋白内密码子设计 reward 与真实滴度的相关性(CDS 设计在单个蛋白内的排序质量),不是上文描述的跨蛋白构建体-表达排序(ρ≈0.12–0.37)。两者勿混。
6. 数据护城河:专利 + 中文
Evolrix AI 挖掘专利与中文文献,这是多数以英文为中心的蛋白工程工具所忽略的两类来源。大量实用的、与工业相关的 毕赤 know-how 实际上正存于此处——专利披露了期刊论文常省略的构建体细节、滴度与工艺条件,而全球工业酶与饲料酶的 毕赤工作有相当大比例以中文发表。数据资产堆叠为三层:
| 层 | 规模 | 用途 |
|---|---|---|
| 文献语料 | 66k 全文(1,950 篇毕赤)+ 知识图谱 | 检索 / 接地 |
| Host-engineering 结构化 | 664 条总计(~627 调控 + 28 糖基化 + 23 文献 + 9 序列),24 个跨源 fold,83 个来源 | 构建体优化 |
| 乳铁蛋白案例 | 4 家中国机构 | 跨源验证证据 |
Host-engineering 层的扩展进展是明确的:跨源 fold 已从 9 → 24,超额达成 v0.1 设定的 15+ 目标。下一步是补弱小样本 fold(lipase、insulin)、清理调控元件词表以上线精确推荐工具。证据是具体的:对于乳铁蛋白,平台从四家中国机构——芝诺、江南大学、蒙牛、三元——提取表达数据[7],这是任何仅英文检索器都无法触及的语料。乳铁蛋白案例的关键不在蛋白本身,而在覆盖度的证据:如果平台能跨四个独立中文来源交叉验证一个蛋白,同样的检索就能以同样方式触及其余中文 毕赤语料。
覆盖台账与诚实边界
权威语料计数(经后端 corpus_counts.py 核验,2026-07-12):
| 来源层 | 记录数 | 去重专利 | 整理等级 | 最后更新 | 已知缺口 |
|---|---|---|---|---|---|
| 专利+文献证据(全 CN) | 2,580 | 386 | 混合:186 高质量 / 785 中等 / 1,612 待核验 | 2026-07-06 | CNIPA/CNKI 全文墙阻断 API 访问——最大缺口 |
| 宿主工程结构化 | 664 | 83 来源 | 已整理(regulatory/glyco/lit/seq) | 2026-07-06 | 小样本 fold 偏弱(lipase、insulin) |
| 文献语料(全文) | 66k(1,950 Pichia) | — | Qdrant 索引 | 2026-06 | 序列变体数据实际缺失(regime 不匹配) |
诚实定位:这不是"完整的中文 毕赤 数据壁垒"。这是一个高质量但不完整的语料——386 篇去重专利、2,580 条证据记录,以中文为中心,但有真实覆盖缺口(CNIPA/CNKI 全文访问墙、弱小样本 fold)。我们的主张是方法(检索+结构化提取+跨源验证)是可靠的,乳铁蛋白 4 机构案例证明了这条路径;主张不是覆盖已穷尽。我们如实说明,因为做受监管决策的客户需要确切知道证据在哪里变薄。
7. 非甲醇表达系统
甲醇诱导型 AOX1 是 毕赤的经典选择,能给出很高的滴度,但工业生产越来越需要非甲醇系统——出于安全、规模与监管原因。这是工业刚需,而非研究好奇。甲醇易燃且急性有毒——2–5% v/v 即对细胞致死[11]——燃烧热高导致耗氧大,并触发更严格的火灾安全分级、防爆环境与大型发酵罐的强冷却。非甲醇体系免去了这些开销,业界正稳步迁移至此。Evolrix AI 的 host-engineering 数据覆盖完整的非甲醇启动子工具箱:
| 启动子 | 调控 | 用例 |
|---|---|---|
| pGAP | 组成型(甘油醛-3-磷酸脱氢酶) | 最常用组成型;可近 AOX1 水平,无需诱导剂 |
| pGCW14 / pUPP | 组成型(GCW14 商用变体) | 强组成型;pUPP/PDF 对 CalB 达 pGAP 的至多 9×[12] |
| pTEF1 | 组成型(翻译延伸因子) | 高组成型表达 |
| pPGK1 | 组成型(磷酸甘油酸激酶) | 稳定组成型表达 |
| PDH / PDF | 去阻遏诱导型(补料速率控制) | 兼具「可诱导」与「无甲醇」;仅靠补料速率控制[12] |
实践中为何去甲醇很重要:它从工艺中移除了一个易燃有毒的诱导剂,简化了放大(无需甲醇补料策略或尾气处理),并减轻了甲醇分级带来负担的监管申报。文献显示 PUPP/PDF 对 CalB 的比生产率可达 pGAP 的至多 9×[12]——说明「选对非甲醇系统」本身就有巨大优化空间,正是模型推荐的价值所在。平台数据已覆盖甲醇与非甲醇构建体(如学到的 pCS1、pGAP 效应),可直接回答「该用甲醇诱导还是非甲醇组成型、哪个启动子」,并按产物类型、是否要求无甲醇、放大阶段给出分场景推荐。
8. 产物边界
Evolrix AI 的产物边界是重组蛋白加活性分子。蛋白侧横跨工业酶与治疗性蛋白;活性分子侧通过代谢工程把宿主延伸到高价值小分子。旗舰案例之外的具体例子:
| 类别 | 例子 | 为何用毕赤 |
|---|---|---|
| 工业酶 | 植酸酶、脂肪酶、纤维素酶 | 高密度分泌、二硫键折叠 |
| 治疗性蛋白 | HSA、胰岛素 | 真核翻译后修饰、GRAS 路径宿主 |
| 活性小分子 | α-檀香烯(21.5 g/L)、透明质酸(0.8–1.7 g/L)、3-HP | 甲羟戊酸 / 代谢途径工程化[6] |
活性分子一侧并非愿景:α-檀香烯已通过工程化的甲羟戊酸途径在 毕赤中达到 21.5 g/L[6],透明质酸达 0.8–1.7 g/L,3-HP 可从甲醇合成——显示该宿主在蛋白之外向高价值小分子的延伸。植酸酶、脂肪酶、纤维素酶等工业酶是今日 毕赤制造的基本盘;人血清白蛋白(HSA)与胰岛素等治疗性蛋白则利用了宿主的真核折叠与分泌。平台的范围是这些的并集,而非单一产物类别。
9. 商业与落地
Evolrix AI 的商业路径面向三类客户,按谁实际运行毕赤蛋白表达来划分:
| 客户 | 痛点 | 切入 |
|---|---|---|
| 科研院所——高校/研究所的合成生物、蛋白工程实验室 | 选构建体靠试错;查文献费时 | 低门槛工具 + 可审计证据;先建口碑与数据飞轮 |
| 医药公司——生物药/重组蛋白研发团队(含 CRO/CDMO) | 表达优化慢;筛选成本高 | 加速表达构建体设计,缩短从基因到首批产物的周期 |
| 合成生物公司——工业酶/蛋白/生物制造企业 | 提高 titer;降低发酵成本 | 构建体/工艺推荐 + 结构验证,直接对 titer 与成本负责 |
这些客户所在的市场体量大。如上所述,上位合成生物学市场 2025 约 US$197.5 亿 → 2031 约 US$564.8 亿,CAGR 约 19%[10];更直接的蛋白表达市场 2025 约 US$30–51 亿 → 2031/2035 约 US$50–77 亿,CAGR 约 8–9%,其中 CRO/CDMO 是增长最快的终端、亚太是增速最快的区域。该模式已有对标:Cradle Bio 的客户正是医药(Novo Nordisk、J&J)+ 化工/食品/农业,印证「科研 + 医药 + 合成生物」三类客户的真实性;Evolrix AI 的差异是聚焦毕赤宿主与中文/专利数据。
参考已验证的 Cradle Bio 商业模式,建议 Evolrix AI 采三层定价:
| 层 | 形态 | 面向 |
|---|---|---|
| 入门/学术 | 低价或免费 web 工具(evolrix.bio/science) | 科研院所——建口碑 + 数据飞轮 |
| 专业/API | 订阅 + 全 API,接入客户 pipeline;客户数据训私有模型,IP 归客户 | 医药/合成生物研发团队 |
| 企业/项目制 | 按项目/按分子收费 + 私有部署 | 大型药企/CDMO——加速研发作为可量化价值锚 |
可量化的价值主张锚定这三层:省时间(从「查文献+试错选构建体」到「模型推荐+证据溯源」);提 titer / 降成本(构建体/工艺推荐直接对表达量负责);可信/可审计(每条推荐带专利/文献出处 + 结构验证,区别于黑箱工具);以及数据护城河 → 客户飞轮(客户湿实验回流持续改进模型,且 Evolrix AI 独有中文/专利数据基座)。具体定价数值将以早期客户校准,因为 AI 蛋白平台多为企业级不公开报价,Cradle/Basecamp 均未公开单价。
10. 知识产权
Evolrix AI 正在跨软件著作权与发明专利构建 IP 组合,相关申请进行中:
- 软件著作权(计划约 12 件),覆盖:Kairos agent 编排层、host-engineering 校准引擎、结构验证工具、检索/知识图谱模块。
- 发明专利(计划约 6–8 件),方向包括:①离散调控特征的表达构建体推荐方法;②可验证 AI 研究工作台架构;③专利/文献表达数据的结构化挖掘与去混流水线。
- 竞赛/资质:参与全国颠覆性技术创新大赛。
在商业与 IP 主张之外,应坦率说明两条边界——而我们把「坦率说明」视为一项信任凭证,而非局限。一个能精确告诉你「它的置信度止于何处」的平台,才是你可以据以做出受监管决策的平台。其一,Boltz-2 结构输出是预测,而非实验结构——它们有接地且校准良好,但并非晶体学或 cryo-EM 数据;平台标注其为预测,绝不冒充为测量值。其二,表达构建体效应是来自跨源相关性[5]的方向性证据,而非保证的结果——平台区分可计算轴(within-source ρ≈0.12,跨源 ρ≈0.26)与湿实验轴(特定情形的绝对 titer),并把后者标记为「在任何生产主张之前需验证」。主张严格依据证据;预测标注为预测,构建体效应标注为需湿实验验证的方向性证据。在一个「黑箱承诺它一定行」是常态的行业里,这种纪律恰恰是医药或 CDMO 客户能够真正采纳其产出的基础。
11. 路线图
全链为 序列设计 → 表达 → 发酵 → 纯化。各层的状态以能力地图给出——今日已验证什么、什么在推进、什么在规划——使投资者或伙伴能清晰看到平台证据所在之处与下一个拐点在哪里:
设计层——已验证
- Kairos agent 编排(reason → retrieve → design → verify → artifact)。
- 通过 Boltz-2 的结构验证,已上线 /science/(实测 0.93 / 0.48)。
- 表达构建体优化已跑通,跨源 ρ 稳定;已含发酵条件维度。
- 白皮书 v0.5(本文档):以 24 个跨源 fold 加厚实证。
制造层——规划中,需湿实验伙伴
- 小试 → 中试放大(发酵工程):规划中,需工艺数据与湿实验伙伴。
- 分离纯化(下游 DSP):规划中,收率/纯度优化。
- 数据回流闭环:设计层内部分已有;制造层回流待建。
近期与中期
- 精确推荐工具上线(调控元件词表清洗)。
- 主动学习闭环——挑信息量最大的湿实验(DBTL 的 Learn 阶段)。
- Kairos 补全(reviewer + retrieval 进 agent)。
- 湿实验/工艺伙伴对接 → 打通制造层(小试 → 中试 → 分离纯化)。
- 多宿主扩展——方法学从毕赤迁移到大肠杆菌、其他酵母乃至哺乳细胞宿主(验证后)。
- 白皮书 v1.0(商业数值 + IP 受理号)。
这两层并非两条独立管线;它们由一条主动学习主轴相连。随着制造层运行——真实的发酵批次及其测得的滴度、真实的纯化收率——这些结果数据回流到 host-engineering 数据集。一个表现超出或低于平台预测的构建体,成为一条新的标注记录,锐化下一次 ρ 估计与下一次效应值调用。设计层今日已验证;制造层在路线图上,连接到同一证据与依据主轴,使闭环端到端保持可审计。
参考文献
- FDA 生物制品许可申请(BLA)及批准:Kalbitor(BLA 125277)、Jetrea(BLA 125422)、Semglee(BLA 761201)。美国食品药品监督管理局。FDA 生物制品批准。
- Zha J, 等. 毕赤酵母代谢工程研究进展:强大的细胞工厂. J Fungi (Basel), 2023. doi:10.3390/jof9101027。
- 市场数据:植酸酶市场规模(约 $3.5 亿/年)与毕赤商业化规模(>5,000 蛋白、>70 产品、>300 已授权工业流程、>300 家生物技术/制药公司)。Mordor Intelligence / MarketsandMarkets, 2025–2026 报告;Biomolecules 13(3):441 (2023);Front. Biosci.-Elite (2024)。
- Evolrix AI Science. 结构验证实时演示:泛素野生型 pLDDT 0.93 对打乱序列 0.48(Boltz-2 预测)。evolrix.bio/science。
- Evolrix AI host-engineering 数据集(v0.5):~627 条 regulatory 记录,来自 83 个独立来源;21 个跨源 fold;within-source(去混淆)Spearman ρ≈0.12;跨源 ρ≈0.26;总体 ρ≈0.37;高置信 fold xylanase/mannanase ρ 0.76–0.89;学到的启动子 pCS1 效应 +0.7(n=62);伴侣 ERO1/SBH1 正效应。evolrix.bio/research。
- α-檀香烯在毕赤酵母中的报道产量 21.5 g/L;透明质酸 0.8–1.7 g/L;3-HP 从甲醇合成。Zha J, 等. J Fungi 9(10):1027 (2023);Metabolic engineering of K. phaffii for 3-HP production from methanol, PubMed 39979934 (2025)。
- 人乳铁蛋白表达数据来自 4 家独立中国机构:CN118147180A(芝诺)、CN115960175A(江南大学+蒙牛)、CN116970503B(江南大学)、CN1718726A(三元)。中国专利数据库(CNIPA / Google Patents)。
- NCBI Bookshelf. Design-Build-Test-Learn: Impact of AI on the Synthetic Biology Process(The Age of AI in the Life Sciences)—— DBTL 标准循环;AI/ML 切入 Design 与 Learn 两相,foundry 自动化 Build/Test。
- 「十五五」规划(2026–2030)来源:《中共中央关于制定国民经济和社会发展第十五个五年规划的建议》(二十届四中全会,2025)+《「十五五」规划纲要》(生物制造列为前瞻布局六大未来产业之一,NDRC/新华 2026-04);工信部《「十五五」生物制造发展规划》编制(新华网 2025-12-19:明确标志性产品与人工智能典型应用案例、培育中试平台);2025 生物制造大会数据(总规模约 1.1 万亿元、发酵产能占全球 70%+);易凯资本预测 2030 中国生物制造约 1.8 万亿元、占全球近 25%。
- Mordor Intelligence. Synthetic Biology Market 2026–2031 —— US$19.75B(2025)→US$56.48B(2031),CAGR 19.14%;基因工程占 33.21% 份额,亚太增速最快;AI 集成被列为核心增长驱动。
- Bi-directionalized promoter systems for methanol-free peroxygenases, Microb. Cell Fact. (2024)—— 甲醇毒性(2–5% v/v 即对细胞致死);Engineering the expression system for K. phaffii: a methanol-free expression system, PMC6736287 —— GAP/DAS1 工程、非甲醇路线。
- Bioprocess performance of novel methanol-independent promoters (PDF/PUPP), Microb. Cell Fact. (2021)—— PUPP/PDF 对 CalB 至多 9× PGAP;Enabling growth-decoupled K. phaffii production based on the methanol-free PDH promoter, PMC10076887。
- Jacobs P, 等. Engineering complex-type N-glycosylation in Pichia using GlycoSwitch. Nat. Protoc. 4:58–70 (2009);pichia.com GlycoSwitch —— OCH1 敲除、人源化糖基化、SuperMan5。
- 全球合成生物学国家战略 [R43]:美国第 14081 号行政令《推进生物技术与生物制造创新》(2022-09)+《芯片与科学法案》国家工程生物学研发计划 + 国防部 BioMADE;英国《工程生物学国家愿景》(DSIT,2023,10 年 20 亿英镑,五大关键技术之一);欧盟 2024-03 生物技术与生物制造加速措施 + 欧盟委员会生物经济国别战略(JRC,2025-09);韩国《合成生物学育成法》(2025 通过、2026 施行,全球首部专门立法,MSIT)+ 国家战略技术(2023-12);日本生物经济战略(100 万亿日元市场目标)。经济体量引 McKinsey《Bio Revolution》、英国 business.gov.uk 工程生物学——每年 2-4 万亿美元全球经济影响(2030-2040),本世纪末约 30 万亿美元(约占全球制造业 1/3)。综述来源:SynBioBeta《The Influence of Synthetic Biology on National Bioeconomy Strategies》(2024)、OECD 合成生物学治理报告。