Рукавичка замість коду: як Reward AI вчить роботів за 30 хвилин
Поки більшість розробників намагаються прописати роботам кожен рух через складні алгоритми або змушують операторів годинами сидіти у VR-шоломах, стартап Reward AI вирішив піти шляхом найменшого опору. Вони створили систему, де машина просто «дивиться» на рухи людини та копіює їх. Головним інструментом у цьому процесі стала рукавичка Omnibody Hand.
Залізо для зчитування реальності
Omnibody Hand — це не просто черговий маніпулятор, а насичений сенсорами пристрій для збору даних. Вона оснащена тактильними датчиками, сенсорами наближення та камерами з глобальним затвором. Такий набір дозволяє фіксувати не лише траєкторію руху руки, а й найдрібніші деталі взаємодії з об’єктами: від моменту наближення до сили та характеру захоплення.
Для точного відстеження положення в просторі розробники Reward AI об’єднали візуально-інерціальну систему з електромагнітним позиціонуванням. Таке комбо виявилося ефективним: під час тестів на високих швидкостях середня помилка міграції заданої точки скоротилася на 60%. Це критично важливо, коли йдеться про делікатні маніпуляції, де зайвий сантиметр може означати розбиту склянку або зіпсовану деталь.
OM-1 обробляє мультимодальні сенсорні потоки, отримані за допомогою системи Omnibody Hand, і генерує дії зі швидкістю, властивою людині, для різних роботизованих тіл. Ілюстрація: Reward AI
Модель OM-1: навчання без посередників
Усі зібрані дані надходять до OM-1 — універсальної моделі управління. Її фішка в тому, що вона вчиться безпосередньо на демонстраціях людини. Тут немає потреби у телеприсутності чи попередньому «дресируванні» на конкретному залізі. Модель поглинає зображення, тактильні сигнали, дані про відстань між пальцями та траекторію руки.
На виході OM-1 видає чіткі параметри: напрямок, швидкість руху, силу та моменти ключових подій. За заявою компанії, для освоєння нового завдання, включаючи складні контактні дії та довгі послідовності рухів, системі потрібно менше ніж 30 хвилин записів. У світі навчання роботів через імітацію це майже миттєво.
Автономність та адаптивність
Безпосереднім виконанням команд займається окремий шар управління, який попередньо натренували з підкріпленням у симуляції. Він працює на високій частоті незалежно від швидкості роботи основної моделі OM-1. Це дозволяє згладжувати переходи між діями та компенсувати затримки або зовнішні завади. Головна перевага такого підходу — універсальність: вивчені навички можна переносити між різними роботизованими платформами без необхідності переучувати модель під кожен новий маніпулятор.
Поки індустрія сперечається про те, чи замінить ШІ програмістів, Reward AI наочно показує, що він цілком може замінити складні інструкції простою демонстрацією «роби як я».
Доки одні вчать роботів рухатися, інші оптимізують залізо для їхніх мізків. Так, Samsung позбувається DDR5, передаючи виробництво на аутсорс, щоб повністю зосередитися на рішеннях для штучного інтелекту.