
长久以来,科学家一直被困在一个令人挫败的悖论里:人类能轻易读出生物体基因组里那数十亿个碱基“字母”,却对其中海量蛋白质的真实功能一头雾水。如今,人工智能正试图推倒这堵高墙。
研究人员刚刚推出一类革命性的AI系统,它能将蛋白质的氨基酸序列直接“翻译”成人类能读懂的自然语言描述,精准输出该蛋白质的具体功能、参与的生物过程以及在细胞内的定位。这一里程碑式的突破,被不少业内人士誉为蛋白质功能注释领域的“ChatGPT时刻”。
暗蛋白质组:生命中最大的未解之谜
所有的蛋白质都由基因编码,它们是细胞执行一切生命活动的分子工具——从消化食物到免疫防御,样样离不开它们。
尴尬之处在于,我们能“读”出序列,却往往不知道它在“干”什么。在人类基因组中,约80%至90%的蛋白质功能已被破解,但在其他哺乳动物中,这一比例骤降;而在无脊椎动物中,超过半数的蛋白质至今仍是未解之谜。科学界将这片未被照亮的盲区形象地称为“暗蛋白质组”(dark proteome)。
传统的研究逻辑是“比对找亲戚”:将未知蛋白的基因序列与数据库中的已知同源基因对照,以此推断它们可能功能相近。然而,当一个蛋白质在庞大的数据库里找不到任何相似的序列时,这条路径就彻底走到了尽头。
AI改写规则:不靠比较,靠“理解”
这正是大型语言模型的用武之地。西班牙巴塞罗那进化生物学研究所(IBE)的罗萨·费尔南德斯团队,携手安达卢西亚发育生物学中心(CABD),共同开发了名为FANTASIA的AI工具。
FANTASIA的运作机理与大语言模型异曲同工:它将蛋白质序列视作一种独特的“语言”,把DNA片段拆解为语义单元,为每段序列赋予数值权重,构建出一套专属于蛋白质世界的语法体系。通过对海量已知蛋白质数据的深度学习,系统掌握了“哪类序列模式对应哪类功能”的规律,进而对全新的、前所未见的蛋白质做出精准的功能预测。
研究团队利用该工具分析了近1000个动物基因组,以接近100%的准确率,成功为来自“暗蛋白质组”的2400万个蛋白质编码基因标注了功能。更令人惊叹的是效率:在普通电脑上,FANTASIA仅需数小时即可完成一个完整动物基因组的分析;若换用专业工作站,这一流程更是缩短至30分钟。
与此同时,另一个独立团队发布了名为BetaDescribe的系统。它基于700亿参数的大语言模型,同样能直接从蛋白质序列生成详尽的文字描述。测试结果显示,即便是面对那些与已知蛋白几乎毫无序列相似性的“孤儿蛋白质”,BetaDescribe依然能提供极具参考价值的功能解读。
这两套系统的核心共通点在于:它们将蛋白质功能预测从“查字典”式的比对逻辑,彻底升级为“读懂语意”的理解逻辑。
从缓步动物到制药靶点,影响正在蔓延
FANTASIA的首批成果已然十分亮眼。研究者借助它揭开了缓步动物(俗称“水熊虫”)、栉水母和颚轮动物这三大类在生命树上极少被研究的无脊椎动物门类中,大量隐藏蛋白质的功能面纱。此前,这些物种的蛋白质组几乎完全笼罩在黑暗之中。
“从进化的视角看,蛋白质功能的改变、丢失或获得,讲述的是一个物种整个门类的演化史诗,”费尔南德斯解释道,“它能揭示生物体如何适应新环境、以什么为食,或者为何不再需要某些基因工具。”
更直接的应用价值体现在医学领域。FANTASIA被定位为一个高效的“假说生成器”:科学家无需逐个研究每个基因,而是可以先利用AI对整个基因组进行快速扫描,锁定最值得深入追踪的候选靶点,再将资源集中于实验验证。这对于筛选药物靶点、解析疾病机制具有实质性的推动作用。
目前,地球生物基因组计划(EBP)已在其官网推荐使用FANTASIA。有研究者反馈,这套工具不仅在动物研究中表现稳健,在植物、病毒、真菌和原生生物中也展现出极佳的泛化能力。
当然,这类AI系统的预测本质上是概率性的,而非绝对确定性。AI给出的功能描述,仍需通过湿实验进行严谨验证。但它极大地压缩了“从浩瀚未知中锁定研究对象”这一步骤的时间与成本,让科学家能将更多精力投入到真正需要人类智慧的核心问题上。
蛋白质的语言,正被机器智能一字一句地破译出来。




