ChatGPT и подобные ему платформы становятся всё хуже по выдаваемому контенту. Таким наблюдением поделился с читателями ComputerWorld.com аналитик и журналист Стивен Воган-Николс (Steven Vaughan-Nichols).
«Хотелось бы, чтобы инструменты генеративного ИИ (genAI) были действительно полезны. Но они часто не таковы. Я продолжаю возиться с программами — ChatGPT , Meta AI , Gemini и т. д. и т. п. Заметьте, они выглядят полезными, если вы не знаете ничего лучше. Их ответы звучат правдоподобно. Но если вы посмотрите внимательнее, даже если вы простите им их галлюцинации (то есть ложь) — вы увидите, что слишком часто ответы, которые они дают, неверны». — пишет Воган-Николс.
Читайте также
DeepSeek готовит новый раунд финансирования
Он отмечает, что, если вы работаете, скажем, на уровне школьной или студенческой «курсовой», ответы genAI вполне подойдут. Но, если дело касается более серьёзных запросов, это уже совсем другая история. «Чем глубже вы погружаетесь в детали, тем беднее информация». Отметим от себя, что это действительно так, особенно если мы ждём от ИИ чего-то большего, чем просто результата выдачи в поисковике.
Воган-Николс обращает внимание, что «слишком часто конечный результат раздражает и возмутительно неверен. Хуже того, он хаотично неверен… и это не только моё мнение». «Если бы я мог рассчитывать на то, что его ответы будут посредственными, но достаточно точными, я мог бы обойти это. Я не могу» — добавляет он. И пытается объяснить, почему это происходит.
Первая причина — качество контента, используемого для создания основных больших лингвистических моделей (LLM), которые порой обучаются на материале с таких «качественных» сайтов, как Twitter, Reddit и 4Chan. «Как показал Google’s AI Overview в начале этого года, результаты могут быть ужасными. MIT Technology Review отметил, что ИИ выдал такие ответы, как «пользователи [должны] добавлять клей в пиццу» или «съедать хотя бы один небольшой камень в день», и что «бывший президент США Эндрю Джонсон получил университетские степени между 1947 и 2012 годами», несмотря на то, что умер в 1875 году», — отмечает Воган-Николс.
Также он приводит в пример адвоката, чьи юридические документы включали информацию из дел, придуманных ИИ. «Поскольку гиганты genAI продолжают искать больше данных, эта проблема будет только усугубляться… Исследование Epoch AI показало, что к 2026 году у нас закончатся высококачественные данные», — замечает Воган-Николс.
Отсюда следует вторая причина ухудшения. «Сегодня, как никогда ранее, контент, созданный genAI, заменяет экспертный человеческий контент. Результат не только в том, что плохие данные вытесняют хорошие; это еще более коварно», — пишет аналитик. И напоминает, что недавно в одной из статей в журнале Nature было обнаружено, что беспорядочное обучение на основе данных, полученных с помощью других моделей ИИ, приводит к «коллапсу модели» — дегенеративному процессу, при котором со временем модели забывают «истинное распределение базовых данных, даже при отсутствии сдвига в распределении с течением времени»
Воган-Николс называет это «мусор на входе, мусор на выходе» (GIGO). Более научно можно назвать это «рекурсией глупостей» или «рекурсией ошибок». Драматизировать не будем, однако эта проблема реально существует, и её наличие каждый может проверить сам. Особенно, если у вас есть архив более ранних ответов ИИ-ассистентов.





