
人体大多数有核细胞保存着一套基因组,但成熟红细胞没有细胞核,配子只带单倍体染色体,免疫细胞等还会在发育中重排部分DNA。基因组影响外貌、代谢和疾病风险,却不精确规定一个人的全部结果;营养、经历、社会环境和随机发育过程都会参与塑造表型。 单卵双生个体基因组十分接近却仍会出现差异,也直观说明从基因型到表型之间还隔着发育与环境。
核酸能够储存和传递遗传信息,但信息只有在细胞环境中经过复制、转录、翻译和调控才产生作用。性格、学习和记忆等复杂性状涉及众多基因及环境,不能从一段序列直接读出。把核酸理解为生命系统中的信息分子,比把它描述成支配一切的密码更准确。 序列提供可能性和约束,细胞在具体时间、位置和条件下选择性使用其中一部分。
十九世纪中叶,研究者开始从细胞中分离不同化学成分。除糖类、脂类和蛋白质外,米歇尔在白细胞细胞核中得到一种富含磷的新物质。元素组成只是识别线索,后来的纯化和结构分析才逐步说明它属于核酸。
米歇尔在1869年把这种物质称为“核素”(nuclein),因为样品来自细胞核。后来研究发现核酸还存在于细胞质、线粒体和叶绿体中;名称记录了发现史,并不表示核酸只位于细胞核。
DNA是细胞生物主要的遗传物质,RNA在基因表达、调控和催化中承担多种功能,某些病毒则以RNA作为基因组。DNA不直接“主导”每个反应,蛋白质、RNA、膜、代谢物和环境信号共同组成会反馈调节的细胞网络。 这种相互依赖也解释了为何离开细胞的纯DNA通常不会自行复制或产生性状。

核酸是核苷酸通过共价键连接形成的聚合物。每个核苷酸由含氮碱基、五碳糖和一个或多个磷酸基团组成;碱基加糖称为核苷,核苷再加磷酸才是核苷酸。分清这两个名称,有助于读懂ATP、核苷三磷酸和核酸链之间的关系。 ATP也是核苷酸,但常以能量转移和磷酸供体身份使用,展示同一类构件可以进入不同功能体系。
核苷酸的三个组成部分:
核酸链中,一个核苷酸糖的3′羟基与下一个核苷酸的5′磷酸形成磷酸二酯键,所以链具有5′端和3′端。聚合酶通常沿既定方向合成新链,这种方向性对复制、转录和测序都很重要。 读序列时通常按5′到3′书写,互补链则方向相反,这一点会贯穿后续的复制和转录图示。
可以把碱基序列类比为带方向的文字,但类比不能代替结构:糖-磷酸主链决定链的化学性质,碱基配对影响折叠和复制,蛋白质与RNA的结合又决定哪些序列会被读取。
四种主要碱基已经能形成数量巨大的序列组合,不过生物差异并不只来自字母顺序。基因组大小、重复序列、染色体结构、表观修饰、表达时空和细胞网络都参与形成表型,同一序列在不同环境中也可能有不同结果。 比较两个基因组时,研究者既看单个碱基,也看大片段倒位、重复、缺失和移动。
核酸主要分为DNA和RNA。两者都由核苷酸构成,却在糖、常用碱基、链结构和细胞功能上存在差别。理解这些差别时,需要同时看到例外:DNA不总是双链,RNA也不总是短而单链。
细胞通常用DNA长期保存遗传信息,并通过RNA把信息连接到蛋白质合成和调控。RNA还可催化反应、组成核糖体、调节基因表达或引导分子定位;在RNA病毒中,它直接承担基因组功能。 有些RNA分子还能引导化学修饰或基因沉默,因此“传话者”只是它众多身份之一。
DNA中的脱氧核糖比RNA中的核糖少一个2′羟基,这使RNA更易发生某些水解反应,但稳定性还受序列、折叠、蛋白质保护和细胞环境影响。化学差异形成总体倾向,不应简化成DNA永远稳定、RNA必然短命。
在蛋白质编码基因中,DNA序列先转录成RNA,核糖体再依据信使RNA合成多肽。tRNA负责读取密码子并携带氨基酸,rRNA构成核糖体核心并参与催化;非编码RNA还可调控剪接、转录和翻译。
信息流受启动子、转录因子、染色质状态、RNA加工和降解等多层控制。细胞因而能够使用同一基因组形成不同表达谱,并对环境信号作出有时间尺度的响应。 同一基因在神经元和肝细胞中的不同用途,正是多层调控产生细胞分化的结果。
“说明书和便签”能帮助初步区分长期存储与暂时表达,却容易掩盖RNA的催化和结构作用。更完整的图景是:DNA、RNA和蛋白质相互依赖,信息流还受到代谢状态和细胞结构反馈。

DNA和RNA常用的含氮碱基属于嘌呤或嘧啶。碱基序列能够被互补链、蛋白质和RNA识别,但它并不是脱离分子环境单独存在的“含义”;功能来自序列与结构及细胞过程的结合。
嘌呤具有融合双环骨架,腺嘌呤和鸟嘌呤属于这一类;胞嘧啶、胸腺嘧啶和尿嘧啶具有单环嘧啶骨架。细胞还会产生甲基化等修饰碱基,用于调控、识别或损伤应答。
DNA使用A、T、C、G,RNA通常使用A、U、C、G。有限字母可以组成大量序列,但编码区只占许多真核基因组的一部分;调控序列、重复序列、结构区域和可移动元件也具有不同作用和演化历史。
长度为n的单链序列在每个位点都有四种选择,理论组合数为4ⁿ。真实基因组并不会探索所有组合,因为复制可行性、选择、漂变、发育约束和历史路径都会限制实际出现的序列。 一些序列因会破坏折叠或调控而难以保留,另一些近中性变化则可能通过漂变积累。

早期“四核苷酸”假说把DNA设想成四种碱基等量重复的短小分子,因此难以解释信息多样性。样品降解和分析能力有限是误判的重要原因。更温和的提取和物理测量逐渐显示,天然核酸可以是很长且序列不规则的聚合物。
DNA长度跨度很大:病毒基因组可只有数千个碱基,细菌染色体常有数百万个碱基,真核染色体则可达到数千万至数亿碱基。一个DNA分子是否比某个蛋白质大,需要比较具体对象,不能用“多数情况都远远大于蛋白质”概括。 细菌也可携带质粒,真核细胞器也有独立DNA,使“一个细胞只有一条基因组分子”的说法并不成立。
大肠杆菌常用实验株基因组约460万碱基对,酿酒酵母约1200万,人类单倍体核基因组约32亿。水稻、果蝇等物种也有各自数量级,但基因组大小并不按生物外形或行为复杂程度排序。 这些数字还会因品系、组装版本和是否计入细胞器DNA而略有变化,比较时必须统一口径。
核酸长度的发现改变了人们对遗传信息容量的判断,也带来新的问题:长序列中哪些区域被转录,哪些调控染色体结构和表达,哪些来自重复或可移动元件?长度提供容量,却不直接等于功能数量。 例如部分两栖动物和植物的基因组远大于人类,增加的往往是重复序列而非成比例增加的蛋白质编码基因。
二进制类比能说明少数字符也可形成丰富组合,但任何实际存储系统的容量都有限。长度为n的序列有有限的4ⁿ种理论组合,细胞还要付出复制、校对、包装和读取这些序列的成本。
遗传信息储存在什么分子中,曾是二十世纪生物学的核心问题。染色体组成、细菌转化和噬菌体标记等证据逐步表明,DNA是细胞生物主要的遗传物质;RNA病毒则说明核酸类别存在重要例外。

染色体由长DNA分子与组蛋白及其他蛋白质共同组成。碱性染料的染色现象可帮助观察染色体,却不能单凭“亲磷酸”直接判定成分。线粒体和叶绿体含有自己的DNA,核糖体则由rRNA与蛋白质共同构成。 染色质包装会随细胞类型和发育阶段改变,从而影响DNA能否被转录或复制机器接近。
蛋白质结构多样曾使它成为遗传物质候选,DNA的重复性外观一度显得过于简单。决定性问题不是哪类分子更复杂,而是哪种成分能随性状转移、复制并指导可遗传变化。后续实验把这个问题转化为可检验的比较。
烟草花叶病毒等研究说明,病毒不需要完整细胞结构也能携带基因组,但它们必须进入宿主细胞并利用宿主的核糖体、能量和许多代谢系统才能复制。不同病毒以DNA或RNA为遗传物质,蛋白质外壳和部分病毒的脂质包膜则参与保护、进入与传播。 病毒外壳和包膜也决定宿主范围与环境稳定性,不能因为核酸携带信息就忽略这些成分。
病毒基因组测序可以快速确定碱基序列、追踪变异并辅助开发检测方法,但完成速度取决于样本、技术、数据共享和分析流程。序列本身不能回答全部传播和致病问题,还需细胞实验、临床和流行病学证据。
精子把父方单倍体核基因组送入卵细胞,还携带少量RNA和蛋白质,并提供与早期发育有关的细胞成分。其DNA由精蛋白等高度压缩,结构适合运输;这说明DNA是主要遗传贡献,却不能把精子其余成分都说成没有生物作用。 受精后父源染色质会经历重新包装,这一过程把紧密运输状态转换成可参与胚胎复制和表达的状态。
精子与卵细胞的贡献不对称。卵细胞提供母方核基因组、绝大部分细胞质、细胞器和早期发育物质,线粒体DNA通常也来自母方;受精后,两套核染色体共同进入胚胎细胞谱系。
格里菲思在1928年发现,热杀死的有荚膜肺炎链球菌能使活的无荚膜菌发生可遗传转化。1944年,艾弗里、麦克劳德和麦卡蒂进一步分离转化物质,并比较蛋白酶、RNA酶和DNA酶处理;只有破坏DNA会消除转化活性。 转化后的细菌能把新性状继续传给后代,因此观察到的不是短暂生理反应,而是稳定遗传变化。
这些结果支持DNA是该细菌性状的转化因子。样品纯度和当时的技术曾引发讨论,随后多种实验从不同角度加强了结论。科学证据的力量来自可重复结果和替代解释被逐步排除。

赫尔希和蔡斯在1952年分别用³²P标记噬菌体DNA、用³⁵S标记蛋白质,追踪T2噬菌体感染细菌后的分布。感染后,大部分DNA标记与细菌细胞及后代产生相关,大部分蛋白质标记留在细胞外,这支持DNA在该系统中携带遗传信息。 两种标记都不是百分之百分开,结论依赖主要分布差异以及标记与分子成分的对应关系。
标记实验的关键不是寻找“产生遗传变异”,而是比较两种成分在感染过程中的去向。
肺炎链球菌转化和T2噬菌体实验共同支持DNA的遗传作用,但不能推出蛋白质只是包装,也不能覆盖所有病毒。蛋白质负责催化、识别、结构和调控,RNA病毒则以RNA为基因组。准确结论是:DNA是细胞生物以及许多病毒的遗传物质。 实验结论始终要与所研究对象对应:证明T2噬菌体使用DNA,不会自动证明每一种病毒都如此。

核酸在遗传中居于核心位置,却要依赖完整细胞系统发挥作用。DNA保存的序列经RNA和蛋白质表达,代谢提供能量与原料,膜结构建立反应环境,各层还会反向调节基因活动。生命没有一份脱离环境、独自统领全部过程的“总蓝图”。 基因调控网络还能形成记忆、振荡和阈值反应,这些系统性质无法从单个基因的说明中直接读出。
细胞中的分子分工可以这样比较:
早期研究者曾依据蛋白质结构多样而支持蛋白质遗传假说,也曾依据四核苷酸假说低估DNA。后来的判断转向可实验追踪的标准:分子能否与性状共同转移、能否复制、改变后能否稳定遗传。
遗传信息量来自序列长度和组织方式,也来自细胞怎样读取这些序列。增强子可远距离影响转录,同一基因可产生不同RNA,染色质状态还会改变可访问性;仅计算碱基组合并不能预测一个生物。 空间构象也参与调控,原本在线性序列上相距很远的片段,可在细胞核中折叠到一起并发生作用。
DNA序列类比文字或二进制有助于理解编码,却容易让人误以为每个片段都有固定句意。真实基因组包含编码区、调控区、结构序列、重复序列和仍待解释的区域,其功能依赖细胞类型和时序。
核酸研究支撑基因组测序、基因编辑、病原检测、育种和部分基因治疗技术,蛋白质结构、细胞培养、统计分析与临床证据同样不可或缺。技术结果也有边界:检测到序列差异不等于已经证明它会造成某种性状。 负责任的应用需要验证目标、测量脱靶或误差,并把实验效应与真实健康或农业结果分开评价。
核酸连接了遗传、发育与演化,但生命现象来自分子网络而非单条链的独立指挥。研究DNA、RNA和蛋白质的结构及相互作用,能解释信息如何保存、读取、改变并在群体中传递,也能清楚区分已经验证的机制与仍待回答的问题。 这样的视角保留了核酸的核心地位,也让读者看到细胞为何不能被还原成一串静止字符。