Емельян Шарапов, Исследователь городской среды и маршрутов
29 июля 2026 г. · 10 мин
Новые аудиокниги: как я доверился ИИ-озвучке и чему это научило
В начале лета я скачал свежую аудиокнигу — новинку, которую обсуждали в рабочем чате. Через пару минут виртуальный рассказчик уверенно сказал «звóнит» вместо нормативного «звонИт», и стало окончательно ясно: это не живой диктор.

Это нейросеть.
Я не выключил запись. Дослушал главу до конца, потом открыл каталог сервиса и обнаружил: книг с такой озвучкой там уже больше ста двадцати тысяч. Цифра ударила по глазам. Ещё недавно синтез речи был функцией для тех, кому нужно прослушать сообщение или статью. Теперь он претендует на территорию, где голос — половина произведения.
Новые аудиокниги с ИИ-озвучкой уже не выглядят экспериментом для любителей технологий. Их слушают в метро, на пробежке, в очереди, за рулём — там, где текст важнее актёрской школы. И всё же после нескольких недель с виртуальными чтецами у меня остался не восторг и не раздражение, а более сложное чувство: машина действительно научилась рассказывать. Но слушать она пока умеет не всегда.
Эволюция синтеза: от первых «авточтецов» до нейросетевого прорыва
Если вы, как и я, пропустили момент, когда синтез речи перестал звучать как робот из старого навигатора, — вот что произошло. В 2020 году «Литрес» запустил профиль «Авточтец» с технологией синтеза речи Yandex SpeechKit. Тогда это был ровный, почти бесцветный голос: он добросовестно превращал буквы в звук, но не особенно понимал, зачем в литературе нужны паузы, подтекст и интонационные срывы.
Под этим профилем опубликованы тысячи аудиокниг. Библиотека внушительная, хотя по нынешним меркам это уже скорее точка отсчёта. Важен сам принцип: издателю не всегда нужно убеждать продюсера, искать студию и ждать свободного окна у чтеца, чтобы книга вообще получила аудиоверсию.
В июне 2024 года похожий режим появился в «Букмейте», который затем стал «Яндекс Книгами». На старте там было примерно тринадцать тысяч произведений, прежде не имевших предзаписанной аудиоверсии. Алгоритм пришёл не столько на место актёра, сколько в те зоны каталога, куда живой чтец не добирался вовсе: в длинный хвост, к нишевым авторам, к книгам без очевидного коммерческого потенциала.
Это, пожалуй, главный аргумент в пользу технологии. Не каждая книга может позволить себе студийную постановку. Но почти каждая заслуживает шанса быть услышанной.
К августу 2025 года каталог ИИ-озвучки в «Яндекс Книгах» вырос с примерно тринадцати тысяч произведений до более чем ста двадцати тысяч. Важно здесь не арифметическое восхищение, а сам масштаб перемены: за период от запуска сервиса летом 2024-го до августа 2025-го синтетический голос перестал быть редкой опцией в фильтрах. Он стал одним из способов существования книги в цифровом каталоге.
Позже платформа добавила режим «По ролям»: нейросеть сама разбирает текст, отделяет диалоги от авторской речи и раздаёт персонажам разные голоса.
На этом этапе спор «заменит ли ИИ дикторов» становится слишком грубым. Машина не вошла в студию и не отняла у актёра микрофон. Она открыла звук для текстов, которые раньше оставались без него.
ИИ-озвучка начиналась там, куда не дошёл живой чтец — в длинных хвостах каталога. Теперь она уверенно выходит и в топ.
Масштабы цифровой трансформации: 120 тысяч книг в кармане
Когда видишь цифру «120 000+ книг», первая реакция — недоверие. Я полез проверять: открыл приложение, выставил фильтр «ИИ-озвучка» и начал листать. Там оказались и классика, и свежий нон-фикшн, и детективы, которые я когда-то собирался прочитать, но так и не открыл.
Появляется странное ощущение: библиотека перестаёт быть полкой, даже цифровой. Она становится фоном, к которому можно обратиться в любой момент. В дороге захотелось исторический роман — пожалуйста. Вечером понадобилась спокойная книга без тяжёлой актёрской подачи — тоже найдётся. Вопрос «где слушать новые аудиокниги» всё меньше связан с поиском конкретной студии или конкретного диктора. Теперь он чаще сводится к тому, в каком сервисе есть нужный текст и готов ли слушатель принять неидеальный голос.
Раньше путь от книги к аудиофайлу был длинным. Нужно было договориться о правах, выделить бюджет, подобрать чтеца, записать материал, вычитать его, свести звук. Для заметной новинки это логичный процесс. Для небольшой книги — часто неподъёмный.
Нейросеть сокращает именно производственную часть этого маршрута. После того как текст подготовлен, права улажены, а издательская сторона согласовала выпуск, не требуется бронировать студийные смены и подстраиваться под расписание исполнителя. Это не означает, что аудиокнига возникает по щелчку: текст всё равно надо привести в состояние, пригодное для чтения вслух, проверить имена, сокращения, заголовки, примечания и всё то, что на странице выглядит безобидно, а в наушниках превращается в проблему.
Но разница с классическим производством всё равно огромна. Там, где студийная запись предполагает людей, время, переслушивание и монтаж, синтетическая дорожка позволяет расширять каталог быстрее. И для читателя это меняет привычки сильнее, чем кажется.
Я поймал себя на том, что стал чаще давать шанс книгам, которые не купил бы в бумаге и не стал бы специально читать с экрана. Аудиоверсия снижает порог входа: можно послушать первую главу во время дороги, понять ритм текста, закрыть или продолжить без ощущения, что ты обязался «осилить» роман.
У этой доступности есть и обратная сторона. Когда книг слишком много, голос становится не проводником, а интерфейсом. Он должен не мешать. Для части литературы этого достаточно. Для другой — категорически нет.
Технология «По ролям»: как нейросети учатся играть персонажей
Режим «По ролям» — момент, когда ИИ перестаёт быть просто автодиктором. Нейросеть должна сначала понять, кто именно произносит реплику, где заканчивается прямая речь, где автор иронизирует, а где герой говорит всерьёз. Потом — выбрать голос, темп, высоту, паузу. Ошибка на любом этапе слышна сразу.
Я включил этот режим на романе с плотными диалогами и в первые минуты подумал, что слушаю не идеальную, но вполне собранную радиопостановку. Один персонаж говорил низко и неторопливо, другой — быстрее, с нервным нажимом. Авторский текст оставался нейтральнее. Не МХАТ, разумеется. Но и не прежняя плоская дорожка, где один голос одинаково сообщает о смерти героя, погоде за окном и его признании в любви.
Разница особенно заметна в сценах, где без голосового разведения легко потеряться. В бумажной книге читатель видит тире, абзацы, ремарки. На слух всё это должно быть восстановлено интонацией. Когда один рассказчик без изменения тембра ведёт разговор четырёх людей, мозг быстро начинает работать редактором: вспоминать, кто сказал предыдущую фразу, сверяться с контекстом, мысленно расставлять таблички. «По ролям» часть этой работы берёт на себя.
Впрочем, слово «играет» здесь всё же надо употреблять осторожно. Нейросеть умеет имитировать признаки эмоции: ускориться, понизить голос, сделать паузу, чуть изменить тембр. Она не проживает сцену и не строит роль из внутренней логики персонажа. Поэтому в сильных эпизодах иногда получается странный эффект: всё технически правильно, а человеческого напряжения нет.
Особенно это заметно в иронии. Человек-актёр способен провести реплику на полтона мимо буквального смысла — так, что слушатель поймёт: герой врёт, шутит, защищается, боится. Алгоритм чаще выбирает самый очевидный вариант. Если в тексте написано «сказал он весело», голос станет веселее. Если герой говорит весело, но читатель должен услышать отчаяние, машине пока сложнее.
Зато в прозе, где авторская речь важнее психологических дуэлей, такой способ чтения неожиданно удобен. Он не требует от книги превращаться в спектакль. Нон-фикшн, детектив с ясной конструкцией, спокойная жанровая проза, эссеистика — здесь виртуальный голос часто выполняет работу без лишней демонстративности. А это, между прочим, тоже талант: не заслонять текст собой.
Когда машина сама разбирает, кто в тексте говорит, и отдаёт каждому свой голос, это уже не «синтез речи», а первый шаг к синтезу роли.
Человеческий фактор против алгоритмов: почему ошибки в ударениях всё ещё с нами
Вернёмся к тому самому «звóнит». Это не каприз слушателя и не мелкая придирка. Ошибка в ударении работает как выбоина на дороге: можно ехать дальше, но на секунду тебя выбрасывает из движения. Ты слушаешь сцену, следишь за сюжетом — и вдруг вместо «звонИт» слышишь «звóнит». Или вместо «киломЕтр» — «кИлометр». Мозг тут же отвлекается от книги и переключается на проверку реальности.
Проблемными остаются не только общеизвестные слова. Нейросеть может запнуться на фамилиях, географических названиях, сокращениях, иностранных именах, словах с несколькими допустимыми вариантами произношения. Ей трудно там, где человеку помогает не словарь, а контекст: жанр, эпоха, речь персонажа, авторская интонация.
Я за несколько недель насчитал несколько таких моментов в разных книгах. Ни один не заставил меня бросить прослушивание. Но каждый был заметен. И в этом, наверное, честная граница нынешней технологии: она уже не раздражает постоянно, зато всё ещё не умеет исчезать.
У профессионального чтеца другой производственный маршрут. Он читает текст заранее или хотя бы работает с редакторскими пометками, уточняет спорные слова, получает замечания режиссёра и звукорежиссёра. В хорошей студийной записи есть несколько уровней защиты от ошибки. У нейросети тоже могут быть словари и настройки произношения, но она не сомневается по-человечески. Она выбирает вариант и идёт дальше.
Есть и вторая проблема — интонационная монотонность в кульминациях. Алгоритм уверенно держит ровное повествование, неплохо справляется с простыми диалогами, иногда приятно удивляет паузами. Но на эмоциональном пике часто проходит мимо. Там, где актёр едва заметно меняет дыхание или ломает фразу, синтетический голос сохраняет удобную гладкость.
Это не делает аудиокниги с озвучкой искусственного интеллекта бесполезными. Просто их лучше оценивать по их реальной задаче. Они хороши, когда нужно донести текст. Они пока слабее, когда голос должен стать самостоятельным художественным событием.
Мировой опыт и сроки: сколько времени нужно ИИ для создания аудиокниги
У Apple Books цифровая озвучка появилась в 2023 году. Там используются синтетические голоса, созданные на основе работы реальных дикторов, а публикация проходит через партнёрскую и издательскую инфраструктуру. Даже в такой модели создание аудиокниги занимает не мгновение: требуется подготовка текста, оформление прав, техническая обработка и проверка результата.
Это важная поправка к популярной фантазии о кнопке «сделать аудиокнигу». Даже когда читает ИИ, вокруг остаются права, издательские процедуры, контроль качества, подготовка текста и правила площадки. Автоматизация сокращает саму запись, но не отменяет издательскую жизнь произведения.
Российские сервисы устроены иначе по масштабу и набору процессов, но общий принцип тот же. ИИ-озвучка позволяет заметно быстрее расширять каталог после того, как книга поступает в работу, однако точный срок зависит от готовности текста, условий правообладателя, очереди обработки и внутренней редакционной проверки. Слушателю важнее другое: новинки аудиокниг всё чаще выходят не только в традиционной студийной версии — если она вообще была запланирована, — но и в цифровом формате, который делает книгу доступной для ушей.
| Что происходит с книгой | Студийная озвучка | ИИ-озвучка |
|---|---|---|
| Голос | Актёр строит роль и трактует текст | Модель подбирает тембр, темп и интонационный рисунок |
| Появление в каталоге | Зависит от графика записи и полного производственного цикла | Может идти быстрее после подготовки текста и согласований |
| Диалоги | Возможна полноценная работа нескольких исполнителей | Голоса разводятся алгоритмом в режиме «По ролям» |
| Ошибки | Обычно отлавливаются редактурой и переслушиванием | Чаще возникают на ударениях, именах и контексте |
| Главное достоинство | Художественная выразительность | Масштаб и доступность |
Аудиокнига давно перестала быть заменой бумажной для тех, кто не любит читать. Это отдельный способ проводить время с текстом. Её слушают по дороге, во время спорта, уборки, готовки — в те часы, когда бумажная страница бессильна, а экран хочется убрать подальше.
Именно в этот режим ИИ-озвучка вписывается органично. Она не требует от слушателя отдельного ритуала. Можно включить книгу на двадцать минут, поставить на паузу, вернуться через день. В таком формате не всегда принципиально, кто именно читает, если текст звучит разборчиво и не ломает внимание каждые две фразы.
Ехать в метро с виртуальным чтецом: кому это подходит
После нескольких недель эксперимента у меня сложилась простая рабочая схема. Я слушаю ИИ-озвучку в дороге, в спортзале, во время рутинных домашних дел — там, где мне важнее содержание, чем нюанс голоса. Это не унизительное «фоновое потребление», как любят говорить защитники большого искусства. Это нормальный способ читать в мире, где у многих нет двух свободных часов вечером на диване.
Лучшие новые аудиокниги для такого режима — не обязательно самые громкие. Иногда это как раз книга, которой не досталось студийной версии: спокойный нон-фикшн, жанровый роман, небольшое эссе, классика без желания слушать очередную интерпретацию знакомого актёра. Виртуальный голос здесь не конкурирует с автором — он просто доставляет его текст до ушей.
Есть, правда, жанры, в которых экономия на живом исполнителе слишком хорошо слышна. Поэзия держится на дыхании. Сложная драматургия — на паузах и недоговорённости. Роман, где у каждого героя своя речевая пластика, требует не только разных тембров, но и понимания, почему человек замолчал именно здесь. Синтетическая дорожка может быть аккуратной, но аккуратность — не всегда то же самое, что выразительность.
Для вечернего слушания дома, для романа, который хочется именно прожить через голос, я всё-таки выбираю живого чтеца. В хорошей записи слышно не только то, что написано. Слышно, где исполнитель не торопится, где оставляет воздух, где понимает, что пауза страшнее крика. Пока алгоритм умеет воспроизводить форму этих решений, но не всегда их внутреннюю причину.
ИИ-озвучка — это не замена живому чтецу, а второй контур: быстрый, доступный и бесконечно масштабируемый.
Если вы давно откладывали книгу, потому что она не вышла в аудио, стоит посмотреть, где слушать новые аудиокниги с фильтром ИИ-озвучки. Возможно, нужный текст уже ждёт в каталоге. Не надо требовать от него театральной магии и сравнивать каждую фразу с работой маститого актёра.
Просто включите первую главу. Если голос удержит вас в истории — технология справилась с главным. А если на третьей минуте он вдруг скажет «звóнит», а не «звонИт», вы хотя бы будете знать: это не язык изменился. Это виртуальный рассказчик ещё учится слушать русскую речь так же внимательно, как мы.