Mamba: архитектура без внимания, которая бросила вызов трансформерам
Исследователи Альберт Гу и Три Дао представили архитектуру Mamba, полностью отказавшись от механизма внимания - основы современных LLM. Модель показала высокую скорость…
Исследователи Альберт Гу и Три Дао представили архитектуру Mamba, полностью отказавшись от механизма внимания - основы современных LLM. Модель показала высокую скорость…
Разработчик JustVugg создал движок Colibri, который позволяет запускать модель GLM-5.2 с 744 миллиардами параметров на потребительском железе, кардинально снижая требования к памяти.
Новая модель OpenAI GPT-5.6 стала предпочтительной для Microsoft 365 Copilot, что опровергает слухи о разладе между партнерами и знаменует новый этап интеграции…
Новая функция не только упрощает навигацию по истории чата, но и демонстрирует глубину интеграции ИИ-ассистента в рабочие процессы.
На Хабре опубликовано структурированное руководство, которое помогает систематизировать знания для прохождения технических интервью в области обработки естественного языка и больших языковых моделей.
Практический эксперимент показал, что современные ИИ-ассистенты для написания кода способны создать рабочий прототип устройства на ESP32, но их эффективность и качество работы…
На основе модели Qwen3-4B-Instruct-2507 создана специализированная версия для малоресурсного тюркского языка, что стало возможным благодаря разработке морфологического процессора и нового токенизатора.
Сравнительный тест 11 крупных языковых моделей, включая американские и китайские, показал их неспособность идеально реорганизовать сложный "божественный узел" из реального кода LangGraph…
Разработчик столкнулся с критическим падением эффективности модели Qwen Code при создании CLI-агента из-за галлюцинаций. Вместо быстрого решения задачи ИИ тратил часы и…