ESPN DeportesRoma vs. Inter: por qué es el mejor partido que hoy puede dar la Serie APunchGunmen kill father of four in Rivers, family demands justiceRTP DesportoGil Vicente e Marítimo empatam a um golo em BarcelosThe Jerusalem PostUN peacekeeping chief in Lebanon says smooth transition is critical before pull-outוואלהרוכב אופנוע בן 45 התנגש בקיר באזור כרמיאל - מצבו בינוניESPNLSU QB Leavitt, days after doubtful listing, 'ready to go,' Kiffin saysBollywood HungamaDeepika Padukone and Ranveer Singh welcome baby girl; couple shares sweet noteInquirerBohol residents urged to wear masks as haze thickens across provinceCNN TürkCNN TÜRK ekibi görüntüledi: İşte TSK'nın geri dönüşüm merkezi
The Daily Newsstand · Free, Always
Saturday, September 19, 2026

ИИ превратит интернет в Вавилонскую Библиотеку(но хуже)

Translate

Когда надо что-то узнать об инструменте или сервисе, мне хочется сначала посмотреть, что о них пишут другие люди.

И за последний год эта привычка начала сбоить. Страничек в интернете не стало меньше, наоборот их количество выросло. Просто из восьми открытых вкладок семь рассказывают одно и то же, одними и теми же оборотами, в одном и том же порядке. 

Я понимаю, что текст скорее всего писал не человек. Это была ИИ-модель, скорее всего не шибком мудрёная и без грамотного промта. Для ИИ весь мир, вся информация, весть текст - это просто токены. Строки наподобие "RFg♴4#-f体$fÆmZ" и любая другая в конечном счете лишь набор чисел. Смысл за ними придумываем МЫ - человеки. И пытаемся донести этот смысл до нейросети, во время ее обучения. Текст у искусственного интеллекта это ни рыба, ни мясо - что-то усредненное между всеми обучающими данными.

Вот и интернет становится - усредненным. Истина и замысел размывается.

Вавилон

Аргентинский прозаик Хорхе Луис Борхес в 1941 году придумал рассказ про библиотеку, в которой стоят все возможные книги. Не все написанные, а все возможные, то есть любые сочетания знаков, какие вообще можно уложить в книгу. Среди них лежат все настоящие тексты человечества, все их черновики, все переводы и все опечатки к ним.

Рассказ называется «La biblioteca de Babel» , что переводится как «Вавилонская Библиотека». Очень советую прочитать рассказ тому, кто еще этого не сделал. Он коротенький и гуглится за пару секунд.

Так вот, интернет, по моему скромному мнению, приближается к такому состоянию "библиотеки". Но хуже. 

Что случилось в шестигранниках

Рассказ «La biblioteca de Babel» вышел в сборнике «El jardín de senderos que se bifurcan» в 1941 году.

Библиотека из рассказа это мир состоящий из шестигранных комнат. Стены комнат это полки с книгами. 

Всего двадцать полок, по пять длинных полок на каждой стене; кроме двух: их высота, равная высоте этажа, едва превышает средний рост библиотекаря. 

99.9% этих книг по сути просто шлак и бред. Ну из-за бесконечности вариантов этих книг, по закону больших чисел там можешь содержаться абсолютно всё: точная биография в вашей жизни, перевод библии на несуществующие языки, словарь к этому не существующему языку, каталог где указано место всех словарей в библиотеке, кулинарная книга из звёздных войн, ответы на любые вопросы человечества и даже вопросы, о которых это человечество ещё не задумывалось. 

Всё естество людей из этого рассказа весь их смысл жизни это поиск той самый книги(они называют их Откровениями), которые укажут смысл их жизни предскажет их судьбу и будущее. Моря бессмыслицы, десятки тысяч часов тщетных поисков.

Белый шум хуже абракадабры

Возвращаемся к нашему искусственному интеллекту. 

ChatGPT и другие LLM, всё-таки не совсем Вавилонская Библиотека. Их ответы — не случайный набор букв, а предсказания, основанные на обучающих данных, в которых собраны огромные объёмы написанных людьми текстов. 

Они не содержат всего на свете и не способны воспроизвести всё, что когда-либо было сказано или написано. Поэтому, говоря о таких системах, важно помнить: это технологии с собственной историей. На них влияют предубеждения исходных данных, бесчисленные мелкие решения людей, которые их создают, а ещё законы и культурные нормы, из-за которых разработчики стараются не допускать определённых ответов.

И всё же, если говорить именно об источниках информации, мне кажется, что большие языковые модели гораздо ближе к Библиотеке, чем к большинству других привычных нам аналогий.

Например, LLM — это точно не калькулятор.

Калькулятору можно доверять, потому что тот обычно прав, а когда округляет периодическую дробь, ошибается предсказуемо. Модель ошибается гораздо менее предсказуемо. Если она выдаёт неправильный ответ, заранее предсказать, каким именно будет её ошибка, гораздо сложнее.

Поиск информации руками тоже может привести к неверному ответу, но обычно рядом остаются ссылки на источники. Пользователь, который умеет искать, может открыть их, оценить качество и понять, насколько найденное соответствует его задаче. (да, ИИ выдача тоже берет источники как вводные данные, и все равно ошибается, причем очень спонтанно. Один раз мы поспорили с товарищем о том, являются ли два слова однокоренными или нет «порода» и «род». ИИ с уверенностью сказал, что являются, и корень у обоих род. ИИ также прикрепил ссылку на источники. И во всех источниках говорится, что это не так. У слова «порода» корень пород, а не род. Что заставило модель ошибиться, имея на руках правдивые источники, не ясно.)

И самое важное. Доверие к книге, сайту, прибору или человеку держится на вере, что кто-то сверил сказанное с реальными обстоятельствами. Репортёр говорил со свидетелями, исследователь ставил эксперимент, инженер калибровал прибор. Люди врут и ошибаются, но даже врут с апелляцией к чему-то внешнему. Ни книги из шестигранников, ни сырой ответ модели с обстоятельствами не сверялись ни разу.

OpenAI предупредила об этом сама, объявляя research preview в ноябре 2022 года. Система «иногда даёт убедительно звучащие, но неправильные или бессмысленные ответы», то есть иногда выдаёт правдоподобный, но неверный или бессмысленный ответ. Починить это трудно, потому что при обучении с подкреплением «на данный момент нет источника правды».

Мертвый язык

Вот замер за май 2025 года. Ahrefs прогнали 900 тысяч новых англоязычных страниц за апрель, по одной странице на домен. След ИИ нашёлся на 74,2% страниц. Но если разложить всю выборку по типам, полностью сгенерированных там всего 2,5%, полностью человеческих 25,8%, а остальные 71,7% это смесь, где человек и модель писали вместе. 

Ещё они опросили 879 контент-маркетологов, и 87% признались, что ИИ так или иначе используют. Детектор не идеален, сами авторы это оговаривают.

Другие цифры. Graphite в мае 2026 года взял 55,4 тысячи случайных адресов из Common Crawl, оставил англоязычные статьи и статьи-списки с разметкой article не короче ста слов, опубликованные с января 2020 по март 2026, прогнал их через три детектора (Pangram, Copyleaks и GPTZero) и усреднил квартальные доли.

Считают тут иначе, чем у Ahrefs. Там искали любой след машины на странице, здесь ищут статьи, где машинного больше половины.

Через двадцать четыре месяца после запуска ChatGPT доля преимущественно машинных статей дошла до 48 процентов. В четвёртом квартале 2025 года машинные впервые обогнали людей, 50,9 процента. Последние пять кварталов линия держится около половины, то есть это уже не разгон, а плато.

Данные Graphite

Данные Graphite 

Однако около половины новых англоязычных статей в их выборке из Common Crawl, а никакая не половина интернета. Разница огромная, размывать её я бы не стал.

Почему это плохо? Ну помимо того, что приходится читать сгенерированный шлак, это также будет плохо влиять на дальнейшее обучение моделей. Обучаюсь на сгенерирован текстах ИИ троекратно переваривает смыслы и истину. И происходит усреднение уже усредненного.

Shumailov и соавторы в Nature показали, что безразборчивое обучение на сгенерированном тексте даёт необратимый дефект. Если исходные человеческие данные при этом не удерживать, деградация копится от поколения к поколению. (прям таки нейронный инцест)

Оговорюсь и здесь. Это результат про рекурсивное обучение моделей, а не доказательство того, что интернет уже коллапсировал. Второе из первого не следует.

Но мы же все можем подключить внутренних аналитиков и сделать свой небольшой прогноз.

Дефицит не текста, а проверки

Если сложить всё вместе, получается неприятная арифметика. Текста, который выглядит как знание, каждый год становится больше. Людей, которые выходят из шестигранника и сверяют написанное с миром, больше НЕ становится. Информация НЕ проверяется, все принимается за чистую монету.

Вот почему я не готов свести всё к совету научится лучше читать. Навык поиска и проверки информации был и раньше, но раньше он опирался на веб, где источник хоть куда-то вёл. Скоро ссылка будет вести на почти такую же статью, просто написанную другими словами, то истина размывается в потоке пересказов.

Сегодня мы сами допускаем и по сути строим веб, в котором само понятие истины будет постепенно утрачиваться.

У библиотекарей из рассказа было оправдание, которого нет у нас. Их библиотека существовала с начала времен(очень очень давно), они в ней были обитателями, а не авторами. Наша ещё пишется, и фактически уже не нами.

Так что вопрос не в том, отключать ли ИИ или запретить ему писать. Вопрос в том, как найти истину, в океане её иммитирующем.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.