Как весь интернет может поместиться в кусочке сахара?
Объём данных, производимых человечеством, растёт экспоненциально, но физическое пространство для их хранения не поспевает за этим ростом. Жёсткие диски, ленточные кассеты и магнитные архивы занимают место и часто приходят в негодность уже через несколько десятилетий, становясь нечитаемыми. Уже много лет учёные обращают внимание на собственную систему хранения информации, созданную природой, — ДНК. Она до сих пор хранит читаемую генетическую информацию организмов, живших миллионы лет назад, причём в поразительно малом объёме. По оценкам исследователей, один грамм ДНК теоретически может вместить около зеттабайта данных — это почти весь интернет. Это делает ДНК одним из самых серьёзных кандидатов для будущих задач "холодного хранения".
Почему об этом заговорили именно сейчас?
Привлекательность ДНК не сводится только к плотности хранения. Дата-центры потребляют огромное количество электроэнергии и требуют постоянного охлаждения, тогда как молекулы ДНК способны сохраняться в целости тысячи лет при комнатной температуре, в темноте и сухой среде. Это делает ДНК одновременно плотным и устойчивым кандидатом для хранения. В то время как форматы дисков устаревают и становятся нечитаемыми за несколько десятилетий, технология считывания ДНК, по всей видимости, будет существовать столько же, сколько существует сама биология.
Как цифры превращаются в молекулы?
От двоичного кода к четырём буквам
Компьютеры используют двоичную систему, состоящую только из 0 и 1. ДНК же состоит из четырёх строительных блоков: аденина (A), гуанина (G), цитозина (C) и тимина (T). Исследователи, желающие сохранить данные в ДНК, сначала переводят цифровой файл в двоичный код, а затем с помощью специальных алгоритмов преобразуют эту последовательность в цепочку из букв A, C, G и T. Это преобразование происходит не случайным образом: соблюдаются правила, предотвращающие слишком частое повторение одного и того же основания подряд, обеспечивающие химическую стабильность последовательности и добавляющие избыточную информацию на случай ошибок считывания. Полученная последовательность букв — это, по сути, молекулярный перевод фотографии, текста или программного обеспечения.
От синтеза к хранению
Спроектированная последовательность превращается в реальные молекулы ДНК с помощью устройств, называемых синтезаторами ДНК. Этот процесс, называемый "записью", сегодня остаётся самым медленным и дорогим этапом. Синтезированные фрагменты ДНК можно хранить в небольших пробирках — в высушенном или жидком виде. Когда данные нужно снова получить, технология секвенирования ДНК "считывает" молекулы, полученная последовательность букв переводится обратно в двоичный код, и восстанавливается исходный файл. Команды, стремящиеся повысить плотность хранения, также разрабатывают методы "произвольного доступа" — позволяющие с помощью химических меток извлекать из смеси, содержащей миллионы файлов, молекулы, представляющие только нужный файл. Это похоже на то, как можно снять с полки одну конкретную книгу, не потревожив всю библиотеку.
Откуда берётся такая плотность?
Обычный жёсткий диск размещает данные на магнитной поверхности практически в двух измерениях. ДНК же представляет собой трёхмерную молекулу и потому может вместить в тот же объём гораздо больше информации. Кроме того, каждое основание ДНК способно нести гораздо больше информации, чем классический компьютерный бит, поскольку может принимать четыре различных состояния (A, C, G, T) вместо двух. Вместе эти два фактора в тысячи раз сокращают физическое пространство, необходимое для хранения того же объёма данных. Исследователи часто приводят такой пример: если бы все цифровые данные, производимые сегодня в мире, хранились в ДНК, весь этот объём поместился бы не в грузовик, а в ладонь.
Какие препятствия ещё остаются?
Проблема скорости
Главный недостаток хранения данных в ДНК — по-прежнему скорость. Файл, который можно записать на жёсткий диск за секунды, может "записываться" в ДНК часами или даже днями, поскольку синтез ДНК — это химический процесс, при котором каждое основание добавляется шаг за шагом. Исследовательские лаборатории пытаются ускорить запись, одновременно запуская тысячи точек синтеза на электрохимических чипах, однако скорость записи всё ещё значительно уступает магнитным или твердотельным накопителям.
Стоимостной барьер
Производство синтетической ДНК долгое время оставалось весьма дорогим; запись одного мегабайта данных в ДНК стоит во много раз дороже, чем запись на жёсткий диск. Однако стоимость секвенирования ДНК за последние двадцать лет резко снизилась благодаря геномным проектам, и ожидается похожее снижение и в области синтеза. Компании и университеты пытаются снизить затраты, производя ДНК не по каплям, а массово на полупроводниковых чипах.
Устойчивость к ошибкам
Молекулы ДНК чувствительны к химическим реакциям, и при синтезе или считывании в отдельных буквах могут возникать ошибки. Поэтому перед записью в данные добавляется избыточная резервная информация — по аналогии с кодами коррекции ошибок, используемыми при передаче файлов через интернет, — благодаря чему исходный файл можно восстановить без потерь, даже если в нескольких основаниях есть ошибки.
Кто работает над этой темой?
Microsoft Research и Вашингтонский университет уже много лет совместно работают над тем, чтобы превратить хранение данных в ДНК из лабораторного эксперимента в реальную систему, и их команды представили одни из первых полностью автоматизированных сквозных систем хранения данных в ДНК. Различные университеты и биотехнологические компании также сосредоточены на увеличении скорости синтеза, снижении затрат и практическом внедрении произвольного доступа. Некоторые команды используют ДНК не только для хранения файлов, но и для долгосрочного сохранения произведений искусства и даже целых языковых архивов. Эта работа показывает, что хранение данных в ДНК больше не является научной фантастикой, а стало серьёзной инженерной целью.
Что ожидается в ближайшие годы?
Эксперты прогнозируют, что хранение данных в ДНК сначала найдёт применение в архивном "холодном хранении" — то есть для данных, к которым редко обращаются, но которые нужно сохранять очень долго. Спутниковые снимки, медицинские записи, государственные архивы и научные наборы данных считаются одними из первых областей применения. Улучшения в скорости записи и считывания со временем могут расширить область применения ДНК-хранения; тем не менее полностью заменить классические диски или облачное хранилище оно вряд ли сможет — скорее оно станет одним из уровней хранения данных, выбираемым в зависимости от срока хранения и частоты обращения к данным. Иными словами, память нашей цифровой цивилизации однажды действительно может храниться на собственном коде жизни.

