Исследователи объединили два классических подхода к оптимизации ИИ — прунинг и дистилляцию знаний. В стандартных схемах обучения большая модель-учитель передает опыт компактному ученику, существуя как отдельная сущность. В SharedKD полная версия сети сама выступает динамическим наставником для собственной уменьшенной подсети. Градиентно-управляемый механизм позволяет обоим компонентам меняться одновременно, избавляя инженеров от необходимости поддерживать громоздкую структуру учителя.
Несмотря на успех в тестах, технология остается на уровне лабораторного прототипа. Авторы пока не предоставили данных о том, как метод ведет себя на реальных автомобильных ускорителях или как он влияет на задержку обработки кадров и энергопотребление. Чтобы SharedKD стал частью серийных систем автономного вождения, потребуются дополнительные испытания на целевом оборудовании с жесткими ограничениями по безопасности и вычислительным ресурсам.
Комментарии (0)
Пока нет комментариев. Будьте первым!