
从细菌到蓝鲸,细胞都反复使用几类含碳分子:碳水化合物、脂质、蛋白质和核酸。蛋白质、核酸和许多多糖是由重复单元形成的大分子;脂质通常不是聚合物,但因其疏水性质和重要生物功能,常与前三类放在一起讨论。
牛奶中的乳糖会在消化道中被酶分解,酵母则利用一系列酶把葡萄糖转化为乙醇和二氧化碳。两个例子都说明,分子的种类只是起点,真正决定反应能否发生的还有分子的连接方式、三维构象以及它所处的化学环境。
一条蛋白质能否催化反应,一段核酸能否被识别,一种多糖能否形成坚固纤维,都与结构有关。沿着“单体—连接方式—三维结构—生物功能”这条线索,可以把几类分子放进同一套分析框架,而不必把它们记成彼此分离的名词表。
大型碳水化合物、蛋白质和核酸都是链状分子,我们称之为聚合物。聚合物是由许多相似或相同的基本单元通过共价键连接而成的长分子,就像火车由一节节车厢组成一样。这些作为聚合物基本单元的较小分子称为单体。
面粉加水后形成面团,是已有淀粉和蛋白质吸水、相互作用并形成网络的过程,并不是单体聚合的实例。细胞合成不同聚合物时使用的酶和反应机制并不相同,但都需要把单体按特定顺序连接,并通过能量偶联推动反应。
连接单体的反应是脱水反应的典型例子。在脱水反应中,两个分子通过共价键结合,同时失去一个水分子。当两个单体之间形成键时,每个单体都贡献水分子的一部分:一个单体提供羟基(-OH),另一个提供氢原子(-H)。
在概念模型中,脱水缩合通过形成共价键并生成水把较小分子连接起来。真实细胞会先活化单体,再由特定酶或核糖体催化聚合;蛋白质合成和DNA复制不能简单理解成两个游离单体直接脱去一分子水。
水解反应利用水断开共价键,常见于消化和细胞内大分子降解。水解是否释放可供细胞利用的能量,要看反应物、产物和具体条件,不能把“分解”直接等同于“产能”。
聚合物通过水解反应分解为单体,这个过程本质上是脱水反应的逆反应。水解意味着“水的破坏”,通过加入水分子来破坏单体之间的键,其中水分子的氢原子结合到一个单体上,羟基结合到另一个单体上。
例如,当我们吃米饭或面条时,消化道内的各种酶加速聚合物的水解过程。食物中的有机物多数以对细胞来说过大的聚合物形式存在,无法直接进入细胞。在消化道内,酶加速这些聚合物的水解,释放出的单体随后被吸收进入血液,分配到全身各个细胞。然后,这些细胞可以利用脱水反应将单体重新组装成新的、不同的聚合物,执行细胞所需的特定功能。
一个细胞拥有数千种不同的大分子,这些分子的组合因细胞类型而异。遗传差异主要体现在聚合物的微小变化上,特别是DNA和蛋白质。亲属之间(如兄弟姐妹)的分子差异相对较小,无关个体之间的差异更大,不同物种之间的差异则更为显著。
生命界中大分子的多样性是巨大的,可能的变化实际上是无限的。这些分子仅由40到50种常见单体以及一些罕见单体构成,就像用26个字母构成数十万个单词一样。
聚合物的多样性首先来自单体的种类、数量和排列顺序,还来自支链、化学修饰以及折叠方式。蛋白质主要使用20种常见氨基酸,核酸使用少数几种核苷酸,却能通过序列组合形成数量庞大的结构。接下来比较四类分子时,可以持续追问:基本单元是什么、怎样连接、在水中如何表现、结构怎样限制功能。

碳水化合物包括糖类和糖类的聚合物。最简单的碳水化合物是单糖,这些简单糖类是构建更复杂碳水化合物的单体。双糖是双分子糖,由两个通过共价键连接的单糖组成。碳水化合物大分子是称为多糖的聚合物,由许多糖基本单元组成。
当我们在吃早餐时,豆浆中含有蔗糖(双糖),油条中含有淀粉(多糖),这些都是碳水化合物的典型代表。当我们品尝这些食物时,口腔中的淀粉酶开始将淀粉分解为较小的糖分子,这就是为什么细嚼慢咽时能尝到甜味的原因。
单糖的分子式通常是CH₂O的某种倍数。葡萄糖(C₆H₁₂O₆)是最常见的单糖,是生命化学中至关重要的分子。在葡萄糖的结构中,我们可以看到糖类的典型特征:分子具有羰基(C=O)和多个羟基(-OH)。
根据羰基的位置,糖可以分为醛糖(羰基在碳链末端)或酮糖(羰基在碳链内部)。葡萄糖是醛糖,而果糖是酮糖。按照碳骨架的大小,糖类还可以分为三碳糖(丙糖)、五碳糖(戊糖)和六碳糖(己糖)等。
双糖通过脱水反应形成,其中一个单糖的羟基与另一个单糖的氢原子结合形成水分子,同时两个单糖通过共价键连接。这种连接称为糖苷键。
日常饮食可以提供几个便于比较的例子:
许多成年人在摄入较多乳糖后会出现腹胀、腹痛或腹泻,原因通常是小肠乳糖酶活性较低,未被吸收的乳糖进入结肠后被微生物利用。乳糖耐受能力存在明显个体和人群差异,也会受到摄入量、肠道状态和食物搭配影响,因此不能只凭地域判断一个人的耐受情况。
多糖是由数百到数千个单糖通过糖苷键连接而成的大分子。根据功能,多糖可以分为两大类:储存多糖和结构多糖。
植物和动物都以储存多糖的形式储存糖分以备后用。植物储存淀粉,这是一种葡萄糖单体的聚合物,以颗粒形式存在于质体(包括叶绿体)等细胞结构中。
中国作为农业大国,对淀粉的应用有着悠久的历史。从北方的小麦到南方的水稻,再到西南地区的玉米和薯类,这些农作物都是淀粉的重要来源。淀粉的合成使植物能够储存过剩的葡萄糖,当需要时再通过水解作用从这个碳水化合物“银行”中提取糖分。
动物储存的多糖是糖原,也是葡萄糖单体的聚合物,但分支比淀粉更多。人类和其他脊椎动物主要在肝脏和肌肉细胞中以糖原颗粒的形式储存糖原。当血糖水平下降时,糖原的水解释放葡萄糖。
一些多糖用作建筑材料,为细胞或整个生物体提供结构。纤维素是植物细胞壁的主要成分,也是地球上最丰富的有机化合物。
纤维素虽然不能被人类消化,但它是健康饮食的重要组成部分。大多数水果、蔬菜和全谷物都富含纤维素。在食品包装上,“不溶性纤维”主要指的就是纤维素。
纤维素由葡萄糖单体组成,但与淀粉不同的是,它们之间的糖苷键类型不同。这种不同使得纤维素分子能够形成直链结构,平行的纤维素分子通过氢键聚合成束,形成坚固的微纤维。
中国传统造纸工艺就是利用植物纤维素的这种特性。从竹子到桑树皮,再到稻草,这些原料中的纤维素为造纸提供了基础材料。现代的绿色建筑也越来越多地使用纤维素基材料,如竹纤维板材等。
几乎所有动物都缺乏能够消化纤维素的酶,包括人类。然而,一些微生物可以消化纤维素,将其分解为葡萄糖单体。牛等反刍动物在肠道中寄居着能够消化纤维素的原核生物和原生生物,这些微生物水解纤维素并将葡萄糖转化为营养奶牛的其他化合物。

脂质是一组以疏水性或两亲性为共同特征的分子,通常不由重复单体构成长链,因此不能套用典型聚合物的定义。脂肪、磷脂和固醇的结构差异很大,但都含有较多非极性的碳氢区域,使它们难溶于水;磷脂同时具有亲水头部和疏水尾部,因而能在水中自组装成膜。
当我们制作沙拉时,橄榄油和醋会分层,这就是因为油(脂质)具有疏水性。在中国菜中,我们常说“油水不相融”,这句话恰恰说明了脂质的基本特性。
虽然脂肪不是聚合物,但它们是由较小分子通过脱水反应组装成的大分子。脂肪由两种较小分子构成:甘油和脂肪酸。
甘油是一种三碳醇,每个碳都带有一个羟基。脂肪酸具有长碳骨架,通常为16或18个碳原子。碳骨架一端的碳是羧基的一部分,这个功能基团使这些分子被称为脂肪酸。骨架的其余部分由碳氢链组成。
在制造脂肪时,三个脂肪酸分子各自通过酯键与甘油连接,酯键由羟基和羧基之间的脱水反应形成。所得脂肪也称为三酰甘油,由三个与一个甘油分子连接的脂肪酸组成。
中国人的饮食习惯中,不同地区偏好不同的食用油。北方多用花生油和大豆油,南方喜欢菜籽油和茶油,而随着健康意识的提高,橄榄油等进口油品也越来越受欢迎。这些不同油脂的营养价值和风味主要取决于其脂肪酸的组成。
脂肪的主要功能是能量储存。脂肪的碳氢链与汽油分子相似,同样富含能量。一克脂肪储存的能量是一克多糖(如淀粉)的两倍多。由于植物相对固定,它们可以使用淀粉这种体积较大的能量储存形式。然而,动物必须携带它们的能量储存,因此拥有更紧凑的燃料储备——脂肪是有优势的。
磷脂是许多细胞膜的主要成分。它们同时具有亲水部分和疏水部分,在水中能够形成双层;这种自组装性质为细胞建立边界提供了物质基础。
磷脂与脂肪分子相似,但只有两个脂肪酸附着在甘油上,而不是三个。甘油的第三个羟基与磷酸基团连接,磷酸基团在细胞中带负电荷。通常,磷酸基团还连接一个额外的小分子。
磷脂的两端对水表现出不同的行为。碳氢尾部是疏水的,被水排斥,而磷酸基团及其附着物形成亲水头部,对水有亲和力。当磷脂添加到水中时,它们自组装成双分子层,磷脂双分子层形成细胞与其外部环境之间的边界,并在真核细胞内建立独立的隔室。
这种磷脂双分子层的发现对理解生命具有重要意义。中国科学家在膜蛋白结构研究方面做出了杰出贡献,清华大学颜宁教授等人在葡萄糖转运蛋白、钠钾ATP酶等膜蛋白结构解析方面取得了世界领先的成果。
固醇是由四个稠合环组成的碳骨架特征的脂质。不同的固醇通过附着在这组环上的特定化学基团来区分。胆固醇是动物细胞膜的常见组分,也是合成其他固醇(如脊椎动物性激素)的前体。
血液中胆固醇水平过高可能导致动脉粥样硬化,这一疾病过程中沉积物在血管壁内形成,造成内向凸起,阻碍血流并降低血管弹性。
血液中的胆固醇由脂蛋白运输。临床评估通常会结合低密度脂蛋白胆固醇、高密度脂蛋白胆固醇、甘油三酯以及个体总体心血管风险,而不是只看“总胆固醇高不高”。饮食、运动、遗传和代谢状态都会影响血脂,具体干预需要依据可靠检测和专业建议。

生物体几乎每一个动态功能都依赖于蛋白质。事实上,蛋白质重要性通过其名称得到强调,该名称来自希腊词“proteios”,意思是“第一”或“主要”。蛋白质占大多数细胞干重的50%以上,并且在生物体所做的几乎所有事情中都起着重要作用。
在2020年新冠疫情期间,全世界科学家都在研究新冠病毒的刺突蛋白结构,以开发疫苗和治疗药物。中国科学家在这方面做出了重要贡献,从结构生物学研究到mRNA疫苗开发,都体现了蛋白质科学的重要性。
一些蛋白质加速化学反应,其他蛋白质在防御、储存、运输、细胞通讯、运动或结构支撑中发挥作用。
绝大多数蛋白质主要由20种常见氨基酸构成,少数生物还会在特定条件下使用硒代半胱氨酸或吡咯赖氨酸。氨基酸通过肽键连接成不分支的多肽链;一条或多条多肽经过折叠、组装和修饰后,才能形成具有特定功能的蛋白质。
注:数据来源于成人每日必需氨基酸推荐摄入量(mg/kg 体重),实际摄入应结合体重计算。
蛋白质中的常见氨基酸都含有氨基、羧基和侧链。多数氨基酸的α碳连接四个不同基团,因此具有手性;甘氨酸的侧链也是氢原子,α碳不具手性。侧链的电荷、极性和大小差异,是蛋白质形成不同结构和功能的重要基础。
谷物蛋白中的赖氨酸相对较少,豆类蛋白则通常能补充更多赖氨酸,但含硫氨基酸相对受限。把谷物与豆类搭配,可以使膳食氨基酸组成更互补。实际营养价值仍取决于总摄入量、消化率和整体饮食结构,不能把一种搭配理解成自动达到精确“平衡”。
当两个氨基酸定位使得一个氨基酸的羧基与另一个氨基酸的氨基相邻时,它们可以通过脱水反应连接,去除水分子。产生的共价键称为肽键。重复这个过程产生多肽,即通过肽键连接的许多氨基酸的聚合物。
多肽有方向性。一端有自由氨基(多肽的N末端),而相对端有自由羧基(C末端)。多肽的化学性质整体上由侧链的种类和序列决定,这决定了多肽如何折叠,从而决定其最终形状和化学特性。
蛋白质的特定活动源于其复杂的三维结构,其最简单的层次是氨基酸序列。氨基酸序列能告诉我们什么关于蛋白质的三维结构和功能?
有些较小蛋白质能够在适当条件下自发折叠,许多细胞内蛋白质则需要分子伴侣帮助避免错误聚集,还可能在内质网等场所完成修饰和质量控制。球状蛋白质、纤维状蛋白质和膜蛋白所处环境不同,稳定结构的方式也不同。
蛋白质结构研究会综合冷冻电镜、X射线晶体学、核磁共振和功能实验。获得静态结构后,还要通过突变、动力学和细胞实验检验构象变化怎样影响剪接、细胞死亡等过程,结构本身不能自动证明完整机制。
蛋白质的特定结构决定了它的工作方式。在几乎每种情况下,蛋白质的功能都依赖于其识别和结合到某些其他分子的能力。一个特别引人注目的形式与功能结合的例子是抗体(体内的蛋白质)与流感病毒上特定外来物质之间形状的精确匹配,抗体结合并标记这些外来物质以供破坏。

如果多肽的一级结构决定蛋白质的形状,那么什么决定一级结构?多肽的氨基酸序列由称为基因的离散遗传单位编程。基因由DNA组成,DNA属于称为核酸的化合物类。核酸是由称为核苷酸的单体制成的聚合物。
两种类型的核酸——脱氧核糖核酸(DNA)和核糖核酸(RNA)——使生物体能够将其复杂组分从一代复制到下一代。在分子中,DNA独特地提供其自身复制的指令。DNA还指导RNA合成,并通过RNA控制蛋白质合成;这整个过程称为基因表达。
高通量测序使读取DNA序列所需的时间和成本大幅下降,也改变了基因组学的研究尺度。研究者可以同时分析大量基因组,但“测序完成”并不等于“解释完成”:样本制备、读段质量、序列组装、变异判定和临床解释都会影响结果。比较成本时还要说明测序深度、准确率和是否包含后续分析,单独列出某一年的价格容易造成误解。
DNA是细胞生物主要的遗传信息载体。染色体上的DNA包含基因和大量调控序列,细胞分裂前会复制这些DNA。细胞活动并不是由DNA单向控制的程序:RNA、蛋白质、代谢状态和外界信号会共同调节哪些基因在何时、何处表达。
DNA通常不直接承担催化、运输或结构支撑等多数细胞工作。细胞先把部分DNA信息转录为RNA,其中一些RNA再指导蛋白质合成,另一些RNA本身就具有结构、调控或催化功能。蛋白质和RNA的活动又会反过来影响基因表达,形成动态调控网络。
核酸是作为多核苷酸存在的聚合物的大分子。顾名思义,每个多核苷酸由称为核苷酸的单体组成。核苷酸一般由三部分组成:五碳糖(戊糖)、含氮碱基和一到三个磷酸基团。
用于构建多核苷酸的起始单体有三个磷酸基团,但在聚合过程中失去两个。没有任何磷酸基团的核苷酸部分称为核苷。
含氮碱基可分为嘧啶和嘌呤两类。嘧啶具有一个六元含氮环,嘌呤由一个六元环与一个五元环融合而成;环上的官能团决定了不同碱基的配对方式。
DNA中的糖是脱氧核糖,RNA中的糖是核糖。这两种糖的唯一区别是脱氧核糖在环中第二个碳上缺少氧原子,因此得名脱氧核糖。
DNA分子有两个多核苷酸或“链”,围绕假想轴缠绕,形成双螺旋。两个糖-磷酸骨架在相反的5'→3'方向上运行;这种排列称为反平行。糖-磷酸骨架在螺旋外侧,含氮碱基在螺旋内部配对。
在碱基配对中,双螺旋中只有某些碱基彼此兼容。一条链中的腺嘌呤(A)总是与另一条链中的胸腺嘧啶(T)配对,鸟嘌呤(G)总是与胞嘧啶(C)配对。这种配对规则使得DNA具有自我复制的能力。读取双螺旋一条链的碱基序列将告诉我们另一条链的序列。
双螺旋的两条链是互补的,每一条都是另一条的可预测对应物。正是DNA的这一特征使得细胞在准备分裂时可以产生每个DNA分子的两个相同副本成为可能。当细胞分裂时,副本分配给子细胞,使它们在遗传上与亲代细胞相同。
中国在基因技术方面取得了举世瞩目的成就。华大基因作为全球领先的基因组学研发机构,不仅参与了人类基因组计划,还在农业基因组学、医学基因组学等领域发挥重要作用。新冠疫情期间,中国科学家在短时间内完成了病毒基因组测序,为全球疫苗研发提供了重要基础。
与DNA分子相比,RNA分子以单链形式存在。然而,互补碱基配对可以发生在两个RNA分子的区域之间,甚至在同一RNA分子的两个核苷酸片段之间。事实上,RNA分子内的碱基配对使其能够呈现其功能所需的特定三维形状。

20世纪上半叶的实验工作确立了DNA作为遗传信息载体的作用,这些信息代代相传,指定活细胞和生物体的功能。一旦1953年描述了DNA分子的结构,并且理解了核苷酸碱基的线性序列指定蛋白质的氨基酸序列,生物学家就开始通过学习基因的核苷酸序列来“解码”基因。
第一种DNA测序的化学技术——确定DNA链上核苷酸的序列——在1970年代开发。研究人员开始逐个基因地研究基因序列,他们学得越多,问题就越多:基因表达是如何调节的?基因及其蛋白质产物显然相互作用,但是如何作用?不属于基因的DNA(如果有的话)有什么功能?
获得完整基因组序列,可以在统一坐标下研究基因、调控区域和变异。人类基因组计划于1990年启动,工作草图在2000年代初公布,之后仍持续填补缺口、改进参考序列并纳入更多人群。基因组不是一次测完便永久不变的答案,而是一套会随着技术和样本扩展而修订的研究基础。
人类基因组计划的一个意外但深刻的副作用是更快、更便宜的测序方法的快速发展。这一趋势持续至今:2001年测序100万个碱基的成本超过5000美元,到2016年已降至不到0.02美元。而人类基因组,第一个测序花费了十多年时间,以今天的速度可以在几天内完成。
中国研究团队参与了人类基因组计划,并在作物、微生物、人群和疾病基因组研究中持续积累数据。评价一项基因组研究时,比机构规模更值得关注的是样本是否具有代表性、数据质量如何、分析能否复现,以及结论是否超出研究设计所支持的范围。
已完全测序的基因组数量激增,产生了大量数据并促进了生物信息学的发展——使用计算机软件和其他计算工具来处理和分析这些大数据集。
这些发展的反响已经改变了生物学和相关领域的研究。生物学家经常通过分析大组基因甚至比较不同物种的整个基因组来观察问题,这种方法称为基因组学。对大组蛋白质(包括其序列)的类似分析称为蛋白质组学。
在医学研究中,基因组和蛋白质组数据可以帮助识别分子分型、遗传变异和候选标志物。它们能否改善诊断或治疗,需要在独立人群中验证分析性能、临床效用和局限,不能只凭检测到分子差异就下结论。
核酸、蛋白质和多糖由单体按不同方式连接,脂质则主要依靠疏水作用和两亲性形成膜及其他结构。四类分子的功能不能只从名称判断,需要依次考察基本单元、化学键、三维结构和所在环境。
基因组学回答“有哪些序列及变异”,蛋白质组学观察特定条件下出现了哪些蛋白质,结构生物学则研究分子如何形成可工作的三维构象。把这些证据结合起来,才能从相关性逐步走向机制解释。
这些知识能够用于疾病研究、育种、药物开发和环境监测,但应用结果还会受到样本、测量误差和生物系统复杂性的限制。形成持续学习能力的关键,是看到新分子名称时仍能回到同一组问题:它由什么组成,怎样形成结构,在什么条件下工作,证据能够支持到哪一步。