当你构建一个 AI 设计工具时,有一种诱惑:声称它能预测表达。这种声称好卖。但今天它并不诚实。Pichia 中的表达取决于折叠、糖基化、分泌效率、菌株背景、拷贝数、启动子强度、甲醇流加、温度,以及十几个其它任何计算机工具都无法完全计入的变量。一个声称能预测所有这些的设计引擎是在过度承诺。
Kairos 做的事情更窄,但我们相信更有用:它排序干法设计质量——那些可以确定性计算的编码序列与构建体属性。
Kairos 评分什么
四个维度,每一个都从已打印序列计算:
- 合成安全性——这条 CDS 能否顺利通过基因合成?(GC、同聚物、重复、限制性位点、禁止 motif。)
- 宿主相似性——这条 CDS 看起来像 K. phaffii 真正会写出的东西吗?(密码子使用 + %MinMax 节奏。)
- 5′ 翻译起始——起始区对核糖体可及吗?
- 蛋白可开发性——目标蛋白本身的内在风险是什么?(长度、分子量、pI、半胱氨酸、糖基化位点、疏水性。)
Kairos 不预测什么
表达水平。Titer。分泌效率。这些取决于序列之外的变量——菌株、工艺、条件——且需要湿实验测量。Kairos 不会给你一个关于它们的数字,因为产出那样的数字就是说服伪装成预测。
为真相预留的接口
与其假装差距不存在,设计依据为湿实验分析数据预留了一个反馈接口。当表达数据从实验台返回时,它可以被附加到设计记录上——诚实地闭合从干法排序到测量结果的闭环。这是系统的实验就绪设计:不是声称,而是数据落地的地方。
为什么这很重要
一个夸大其范围的工具,在"高分"序列表达很差的第一刻就侵蚀了信任。一个诚实声明范围的工具,在一条精心设计的序列确实表达时赢得信任——因为用户理解分数意味着什么、不意味着什么。出处,不是说服,从说出你不知道的开始。
参考文献
- Sharp PM, Li WH. The codon Adaptation Index — a measure of directional synonymous codon usage bias. Nucleic Acids Res, 1987. PMID:3547335
- Gustafsson C, et al. Codon bias and heterologous protein expression. Trends Biotechnol, 2004. PMID:15245907
- Zha J, et al. Advances in Metabolic Engineering of Pichia pastoris Strains as Powerful Cell Factories. J Fungi (Basel), 2023. PMID:37888283
- Maity N, et al. Statistically Designed Medium Reveals Interactions between Metabolism and Genetic Information Processing for Production of Stable Human Serum Albumin in Pichia pastoris. Biomolecules, 2019. PMID:31590267
范围,逐字。 Kairos 排序干法设计质量——合成安全性、宿主相似性、5′ 翻译起始、蛋白可开发性。非表达量/titer 预测。真正的表达有赖湿实验数据;设计依据中已为此预留反馈接口。