TabFM бросает вызов XGBoost: нейросеть для таблиц без обучения на датасете
Модель TabFM демонстрирует способность предсказывать по табличным данным без предварительного обучения, превосходя по точности на бенчмарках даже тщательно настроенный XGBoost, что может изменить подход к промышленному табличному ML.
В машинном обучении для табличных данных долгое время доминировали классические алгоритмы, такие как градиентный бустинг. Теперь у них появился серьезный конкурент - модель TabFM. Она делает предсказания по таблицам без обучения на конкретном датасете, используя zero-shot подход. Согласно статье на Habr, на стандартных тестах эта нейросеть уже обходит по точности даже тщательно настроенный XGBoost, который долгое время был золотым стандартом. Это ставит под вопрос парадигму, где для каждого нового набора данных нужна отдельная, долгая и ресурсоемкая процедура обучения.
TabFM - это фундаментальная модель, предобученная на огромном массиве разнообразных табличных данных. Такое предобучение позволяет ей понимать структуру и закономерности в новых, незнакомых таблицах и сразу выдавать результат. Ключевое отличие от традиционного подхода - отсутствие необходимости в feature engineering, трудоемком создании и отборе признаков, критичном для успеха XGBoost или Random Forest. TabFM работает с сырыми данными, воспринимая таблицу как последовательность строк и колонок, что может ускорить внедрение моделей в продакшен.
Успех TabFM может означать сдвиг в сторону более универсальных и быстрых решений. Классический табличный ML требует глубокой экспертизы, много времени на подготовку данных и тонкую настройку гиперпараметров для каждой задачи. Модель, которая показывает конкурентоспособные результаты из коробки, открывает путь к демократизации инструментов для аналитиков и инженеров, не являющихся экспертами в ML. Это может изменить экономику проектов, сокращая время от идеи до прототипа с недель до часов.
Однако у TabFM есть ограничения. Ее преимущество ярче всего проявляется на задачах среднего масштаба и сложности. На очень маленьких или экстремально больших датасетах, а также в задачах со специфической доменной логикой, тщательно настроенный бустинг может сохранять лидерство. Zero-shot подход TabFM может не достигать абсолютного максимума точности, который дает ручная настройка классической модели под конкретные данные. Но сама эта конкуренция заставляет пересмотреть устоявшиеся практики.
Для компаний, применяющих ML, модели типа TabFM сулят более простой и быстрый доступ к аналитике. Вместо построения и обслуживания десятков отдельных моделей можно использовать единую фундаментальную модель как сервис. Это снижает порог входа для малого и среднего бизнеса и позволяет data-специалистам сосредоточиться на интерпретации результатов и постановке задач, а не на рутинной технической работе.


