Nat. Comp. Sci. | 警惕大模型的过度自信陷阱—清华大学王童组应邀述评蛋白质语言模型预测新
蛋白质适应度用于量化单个氨基酸突变对蛋白质功能改变与表型修饰的诱导程度,是探究生物学底层机制、开展理性蛋白质设计以及酶工程改造的重要基础。尽管深度突变扫描是当前精准表征蛋白质适应度的标准实验方法,但其高耗时、高劳动力成本以及对特定实验检测体系高度依赖的特点,严重阻碍了其在多样化分子效应高通量评估中的泛化应用。为攻克这一现实难题,近年来,蛋白质语言模型已逐渐发展成为预测蛋白质适应度的核心计算方案。然而,蛋白质语言模型为何能够预测适应度、为何在自然语言处理领域中推崇的 “模型越大效果越好”的理念在这里并不成立,以及在何种条件下应当或不应当应用这类模型进行预测,长期以来仍有待系统解析。