LLM

За пределами Transformer: стартапы ищут новую архитектуру для следующего поколения ИИ

Новые компании пытаются преодолеть фундаментальные ограничения архитектуры Transformer, чтобы создать более эффективные и интеллектуальные модели, способные к планированию и рассуждениям.

Иллюстрация к новости: За пределами Transformer: стартапы ищут новую архитектуру для следующего поколения ИИ

В ИИ набирает силу движение, цель которого - преодолеть ограничения архитектуры Transformer, лежащей в основе всех современных больших языковых моделей. Семь лет спустя после революционной работы Google становится ясно: эта архитектура имеет серьезные недостатки в планировании и сложном рассуждении. Стартапы ищут альтернативы, чтобы создать более эффективные и интеллектуальные системы, способные на настоящее понимание и логический вывод.

Transformer, представленный в 2017 году, произвел революцию в обработке языка. Механизм внимания позволил моделям обрабатывать целые последовательности слов одновременно, что резко повысило качество генерации текста и перевода. Однако его суть - предсказание следующего слова на основе статистики в данных - стала барьером для развития подлинного интеллекта. Модели отлично интерполируют данные, но плохо справляются с многошаговым планированием, логикой за пределами выборки или абстрактными концепциями. Это фундаментальное ограничение стимулирует поиск новых подходов.

Одно из направлений поиска - архитектуры, которые явно моделируют процессы рассуждения. Вместо простого предсказания следующего токена такие системы стремятся строить внутренние представления о мире, причинно-следственных связях и целях. Это может включать интеграцию символического ИИ, работающего на четких правилах, с нейросетевыми подходами. Некоторые стартапы экспериментируют с моделями, которые разбивают сложные задачи на последовательность простых подзадач, имитируя человеческое решение проблем. Другие исследуют способы наделения моделей рабочей памятью и способностью формировать и проверять гипотезы. Конечная цель - выйти за рамки статистического правдоподобия к системам, способным к осмысленному планированию и абстрактному мышлению.

Успех этих инициатив может кардинально изменить ландшафт отрасли. Сегодняшняя гонка LLM во многом сводится к масштабированию: больше данных, моделей и вычислительных мощностей. Новая архитектура, способная к эффективному рассуждению, потенциально снизит потребность в экстремальном масштабировании, сделав мощные системы ИИ доступнее и энергоэффективнее. Это откроет двери для внедрения ИИ в сложной научной работе, стратегическом планировании для бизнеса, создании автономных агентов. Кроме того, конкурентное преимущество может сместиться с обладания огромными ресурсами к прорывным алгоритмическим идеям, что демократизирует разработку ИИ.

Для пользователей и компаний появление моделей нового поколения сулит переход от инструментов, которые перефразируют информацию, к партнерам, способным решать сложные, неструктурированные проблемы. Например, ассистент, который может спланировать весь проект с учетом зависимостей, ресурсов и рисков. Или аналитическая система, которая не просто находит паттерны в данных, но выдвигает и проверяет причинно-следственные гипотезы. Это потребует пересмотра бизнес-процессов и создания новых интерфейсов взаимодействия. Однако путь непрост: новая архитектура должна не только превзойти Transformer в рассуждениях, но и сохранить его выдающиеся способности в понимании и генерации языка. Это сложный, но критически важный вызов для следующего этапа развития искусственного интеллекта.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…