Архитектура решения состоит из трех этапов: кодирование групп столбцов с помощью Set Transformer, формирование векторного представления строк и последующая обработка данных. В систему встроена смесь экспертов, где для каждого токена подбирается оптимальный маршрут, а для работы с крупными массивами предусмотрено использование оперативной памяти или дискового пространства. Компания предлагает два варианта модели: классификатор на 70 млн параметров и регрессор на 71 млн.
В бенчмарке TabArena модель показала конкурентные результаты, заняв четвертое место в общем рейтинге из 51 набора данных с показателем 1659 очков Elo. Согласно внутренним тестам, TabLDM превосходит TabFM по скорости: этап обучения проходит быстрее на 82%, а процесс предсказания — на 68%. Несмотря на эффективность, инструмент имеет ограничения: вычислительные затраты растут квадратично при увеличении числа строк или столбцов. Исходный код проекта открыт под лицензией Apache 2.0.
Комментарии (0)
Пока нет комментариев. Будьте первым!