jhsbj的个人博客分享 http://blog.sciencenet.cn/u/jhsbj

博文

在自家厨房里能做基因测序吗?

已有 254 次阅读 2026-9-7 10:49 |个人分类:生物科技|系统分类:科普集锦

2026年春天,Seth Howes在自家厨房桌上,完成了一件过去几乎只属于大型实验室的事——检测自己的全基因组。口腔拭子采样、提取DNA、建库、上机、得到基因序列数据,全程没有踏进任何专业实验室。数据也从未离开过他的电脑。单次运行的耗材成本,大约1100美元。

屏幕截图 2026-09-05 085815.png

Seth Howes,2024年初获牛津大学(University of Oxford)医学学位。在读医期间曾休学一年,于帝国理工学院(Imperial College London)完成AI机器学习硕士(约2022–2023)。长期有编程经验,自称“从医生转投技术”(doctor defected to tech)。

他为什么要在厨房里干这件事呢

Howes并不是闲得慌。他的家族多代出现自身免疫疾病,姐姐因为自身免疫导致小胆管受损,最终需要肝移植。他并不幻想自己能立刻治愈家族疾病,但想弄清楚一个很朴素的问题:为什么在这个家族里,身体免疫系统会一代代地攻击自体?

同时他也认定:基因组是一个人最私密的数据,不该轻易交给任何公司和他人。

所以他没有把样本寄给商业检测机构,而是决定自己干。开始之前,他几乎没有湿实验经验(亲手做实验室具体工作)——通过六周自学,加上大量AI辅助(包括让AI生成目标区域文件等),完成了从零到一的跨越。

测序仪为什么能变得这么小

先说明一下传统测序和纳米孔测序的区别,这个对照是整个故事的技术底座。

传统高通量测序(以Illumina为代表)靠的是“边合成边测序”:把DNA打断成短片段,在芯片上大量扩增,再用荧光信号读出碱基。通量高、准确度成熟,但设备庞大、文库制备复杂,通常只属于中心实验室。

纳米孔测序走的是另一条路,原理可以这样理解:把一根极细的孔(其实是纳米级的蛋白质孔道)嵌在一层膜上,让DNA单链从孔里穿过去。穿的时候,不同的碱基(A、T、C、G)对电流的阻碍程度不一样,会产生不同的电流波动。仪器每秒记录很多次这种波动,再用神经网络实时把波动“翻译”成碱基字母。

纳米孔DNA动画.gif

因为不需要扩增,也不依赖光学系统,仪器可以做得非常小——MinION只有U盘大小,直接插在电脑上就能用。一块flow cell(流动池,纳米孔测序的"芯片")里大约有上千个这样的纳米孔并行工作。

屏幕截图 2026-09-03 163344.png

这种原理带来三个关键特点:

读长很长。一条读长能覆盖数万甚至更长碱基,对结构变异、复杂区域、重复序列更有优势。

能读原生修饰。DNA上的甲基化等化学修饰会改变电流信号,所以测序列的同时就能直接检测甲基化,不需要额外化学处理。

实时出数据。测序过程中就能看到结果,还能通过软件决定要不要继续测某条DNA链——这就是自适应采样(Adaptive Sampling):先读大约前500个碱基,判断是不是目标区域,是就继续,不是就反转电压把DNA“吐出来”,换下一条。

DNA 双链穿过纳米孔,电流变化实时翻译成碱基——这正是纳米孔测序的原理。

从全基因组到精准靶向

Howes一开始做的是全基因组——把30亿个碱基都读一遍。但实际用起来,很多问题根本不需要读那么多。比如,我可能只想看几十个已知的基因位点(SNP)、几个甲基化位点,再加上端粒的长短。

在这种“精准靶向”的场景下,纳米孔测序的优势反而更明显:想看几十个SNP位点,用扩增子或自适应采样就能轻松覆盖;想看甲基化,一次读长同时给出序列和修饰状态;想量端粒——端粒是高度重复的TTAGGG序列,短读长根本跨不过去,长读长正好适合直接量长度,连不同染色体臂的差异都能分出来。

这三类信息,理论上可以在一次实验里同时拿到。精心设计目标区域、用自适应采样把测序资源集中到这些位点上,一块flow cell的数据就非常高效。

多个样本怎么一起测

如果一次要测好几个人的样本,可以用“条形码”(barcoding)技术:每个样本在建库时贴上一小段独有的“标签”,然后混在一起,放到同一块芯片(flow cell)上测。测完之后,软件按标签自动把数据拆开,每个人的数据各归各,再分别分析SNP、甲基化和端粒等。

目前常用的Native Barcoding Kit 24最多支持24个样本,而且不经过PCR扩增,能保住甲基化信号。在靶向场景下,一块flow cell跑8到24个样本比较现实。

测序仪监控动画_裁切版.gif

Howes 家用测序时的真实运行画面:pore scan、读数、孔状态点阵,实时滚动。

从“交给公司”到“自己动手”

Howes坚持“数据不交给公司”,听起来有点偏执。但过去一年发生的现实,恰好印证了他的谨慎。

直接把基因检测卖给普通人的鼻祖公司23andMe,2006年成立,靠“一口唾液”风靡全球,2021年上市时市值一度达到58亿美元。2025年3月,这家公司申请破产保护;5月,再生元制药用2.56亿美元把它收购——大约是巅峰市值的零头。近1500万用户的基因数据最后归谁管,一度引发很多人担心。

这件事提醒我们:当你把唾液寄给一家公司,你交出去的不只是一份样本,还有一份永远无法撤回的生物信息。公司会怎样、数据会怎样,个体很难控制。DIY测序的意义之一,正是把这份数据主权留在自己手里——数据不出自己的电脑,就没有“被转卖”或“被泄露”的悬念。

医生视角:拿到自己的基因组之后

测序只是第一步,读懂才是更难的部分。这也是这类内容最容易让普通人误入歧途的地方。

一个人的全基因组里,有大量“意义尚不明确”的变异(VUS)。把这些变异当成诊断结论,很容易自己吓自己。专业机构的做法是:把结果交给遗传咨询师或临床医生,结合家族史、临床表现一起判断,而不是对着报告逐个查单词。

换句话说,DIY测序的价值更接近“探索与监测”,而不是“诊断”。如果你想用它指导健康管理,更稳妥的姿势是把SNP、甲基化、基因变异等指标当作长期跟踪的基线——这也是长寿医学目前很看重的方向——然后让专业的人帮你解读变化,而不是自己做决定。

边界要划清楚:设备可以走进厨房,但医学判断仍需要专业训练。Howes的厨房实验证明的是“普通人也能得到自己的基因组数据”,并不等于“普通人能独自承担全部解读”。这两件事,不该被混为一谈。

AI在这项测序里到底帮了什么忙?

简单说,它干的不是打杂的活,而是两件最核心的事——一件是“翻译”,把测序仪记录的电流信号翻成能读的碱基字母;一件是“指路”,帮他把该测的区域挑出来。没有这两件事,机器只能吐出一堆看不懂的信号,也不知道该测哪里。具体有四个关键用处:

第一,当“翻译官”:把电流变成字母。测序仪记录下来的原始数据,其实是一串电流波形,根本不是A、T、C、G这些字母。靠谁翻译?靠一个训练好的神经网络(相当于一个专门学会“听电流”的智能程序)。Howes用的翻译程序叫Dorado,一边测一边实时翻,还能顺手把DNA上的“化学标签”(甲基化)也读出来——这靠的也是升级神经网络,不用换任何试剂。

第二,当“设计师”:帮他把要测的区域挑出来。整条基因组太长,没必要全测。Howes直接用AI助手(Claude)对话:告诉它“我家里有自身免疫病家族史,想看看免疫抑制剂的药物基因”,AI就帮他列出一串候选基因,生成一份机器能读的“目标清单”(BED文件),还自动检查这些区域加起来占比合不合适。这是整个流程里最难的一步,AI几分钟就搞定,换成人工去查各种数据库,要折腾很久。

第三,当“看门人”:决定每段DNA要不要继续读。每段DNA穿过小孔时,软件先读前面约500个字母,实时问一句:“这是我要的区域吗?”是,就继续读完;不是,就立刻把这段DNA吐出去,换下一段进来。靠这个判断,测序仪把力气都花在刀刃上。

第四,当“解读员”:帮他把结果看懂(这是他计划中的下一步)。Howes打算把测序结果交给DeepMind的AlphaGenome,重点看那些过去很难看懂的非编码区变异有没有功能影响。也就是说,AI不止帮你把序列测出来,还能帮你读懂。

一句话总结:这项实验能成,本质上是“用智能软件换掉了一部分实验室的化学功夫”。设备变小了,门槛从“动手做实验”变成了“会用软件”,这正是测序能走进普通家庭的技术内核。

演示文稿1.jpg

不懂代码的医生,AI 能帮你做什么

如果你和我一样,是医生出身的研究人员,不会写代码、不懂编程,不太会计算机程序,那 AI 在这件事里能帮你什么?答案是:把过去需要专门生物信息人员才能做的活,变成“开口问”和“软件自动跑”。Howes 的例子很能说明问题——他几乎没有湿实验经验,靠六周自学加大量 AI 辅助完成了全程。

他借助 Claude 干的最典型的一件事,就是“选区域”:直接告诉 AI“我家里有自身免疫病家族史,想查免疫抑制剂的药物基因”,AI 就帮他列出基因清单、生成机器能读的目标区域文件、核对范围是否合适。换成人工,要查 UCSC、Ensembl、OMIM 好几个数据库、还要写脚本处理坐标,普通医生根本做不来。

除此之外,AI 还自动做了两件你不会做的事:一是把测序仪输出的电流信号翻译成碱基字母(叫 basecalling,纯软件自动跑,不需要懂原理);二是在测序时实时判断每段 DNA 是不是目标区域、决定继续读还是换下一段(自适应采样)。

再单独说“哪些环节绕过了传统二代测序”。传统二代测序(Illumina)有三道绕不开的工序:把 DNA 打断成短片段、PCR 扩增、荧光标记读碱基——设备大、流程繁琐,基本只能进中心实验室。纳米孔测序把这套省掉了:不扩增、不用荧光,DNA 直接穿过纳米孔就能读,文库制备也简单很多。再加上 AI 把“信号翻译”和“目标选择”这两个最专业的部分自动化,一个不懂代码的医生,也能在家完成过去整个实验室团队才能做的事。这正是 Howes 厨房实验对非技术背景的人最有价值的地方。

想测 SNP 和甲基化,一步步怎么做

讲完原理,如果你也想测自己的 SNP 和甲基化,参照Howes 的完整流程可以拆成三步。第一步,也是最关键的一步,是“先想清楚测什么”——他直接用 Claude 对话:告诉它“我家里有自身免疫病家族史,想查免疫抑制剂的药物基因”,AI 就帮他列出候选基因、生成一份机器能读的目标区域清单(BED 文件),还自动核对范围占全基因组比例是否合适。这份清单,决定了测序仪把力气花在哪里。你就可以参照Howes 的做法生成一份检测你的SNP和甲基化的BED 文件。

第二步是湿实验,他用了两个现成试剂盒:先用 NEB 的 Monarch 试剂盒,从口腔拭子里提取 DNA;再用 ONT 的 SQK-LSK114 连接试剂盒建库(给 DNA 片段接上接头,让纳米孔能抓住它)。然后上机:把建好的库加载到 flow cell,用 MinKNOW 软件控制测序,自适应采样会自动跳过无关区域、只测清单里的目标区域。对我个人来讲湿实验不是难点,不用像Howes 那样从头学习。

第三步是数据分析,现在基本都是命令行工具自动跑,照着复制粘贴就能运行,不用会写代码:先用 dorado 做碱基识别(把电流信号翻译成碱基字母)——只要选带甲基化能力的模型,测序结果里就同时含甲基化信息;再用 minimap2 把每条读段比对到参考基因组,确定它来自哪里;然后用 samtools 排序、索引、做质量检查;最后用 mosdepth 对照 BED 清单,算出每个目标位点的覆盖深度够不够。

整个过程,Howes 真正需要动脑的,是“提对问题”(用 Claude 选区域)和“看懂结果”,中间的技术环节基本被 AI 和现成工具包办——这正是对非技术背景医生最有吸引力的地方。对不懂代码的医生来说,关键就是:不用理解命令里的每个词,照抄照跑就行—— 这也是 AI 时代测序门槛降下来的原因。

从厨房到诊室:这项技术正在被谁用上

Howes 不是一个人在这条路上走。2026 年 8 月,纳米孔测序的制造商 Oxford Nanopore 发布了新的战略:把重心押在三个方向——mRNA 疫苗的质检、全基因组里的甲基化检测、白血病诊断。这家公司正式把赌注从“实验室和爱好者”转向“药企和临床”,要让纳米孔进入制药质量控制和医院诊断的日常流程。

在波兰,玛丽·居里肿瘤中心已经改用纳米孔技术做肿瘤分析,靠甲基化信号给肿瘤分类,正在取代传统的短读长测序;在中枢神经系统肿瘤的快速分类上,有些医院已经把出结果的时间压缩到 30 分钟左右。结核病领域,Oxford Nanopore 与 bioMérieux 合作推出 AmPORE-TB 方案,用来快速确定耐药结核,帮医生更快决定用药。

这些进展说明一件事:Howes 在厨房里验证的技术逻辑——长读长、直接读甲基化、小巧灵活——正在被医院和药厂用同样的方式验证。个人和机构,沿着同一条技术曲线往前走。这也是为什么我们说“测序正从少数机构的专属工具走向更广阔场景”,不是一句展望,而是正在发生的事。

Seth Howes的厨房实验,并不是要证明“从此测序可以完全取代专业实验室”,而是展示一种新的可能性:当设备变得足够小、足够灵活,当AI能显著降低技术门槛,个人在隐私可控的前提下探索自己的基因组,已经不再是完全的幻想。

从全基因组到只关注几十个关键位点,从单人实验到多样本并行,技术路径正在变得更精细、也更可及。判断这项技术有没有进入“普通人的日常”,可以看四个变量:需求是否真实、成本是否持续下降、使用门槛是否降低、解读是否跟得上。如果只有设备变便宜,解读和配套服务还跟不上,那它更适合作为专业医疗的补充,而不是替代。



https://blog.sciencenet.cn/blog-3302154-1551353.html

上一篇:普通人长寿观的改变:拒绝数字游戏,回归平凡幸福
下一篇:肿瘤氧化还原检查点



    
收藏 IP: 110.65.147.*| 热度|

4 崔锦华 农绍庄 宁利中 杨文祥

该博文允许注册用户评论 请点击登录 评论 (1 个评论)

数据加载中...
扫一扫,分享此博文

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-8 19:18

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部