Штучний інтелект рою, автономні системи та дрони
Ця презентація розглядає штучний інтелект рою для автономних і напівавтономних роботизованих систем, з особливою увагою до дронів. Вона розвиває ідею, що складна та стійка колективна поведінка може виникати завдяки співпраці відносно простих агентів ШІ, спираючись на приклади природного інтелекту рою, виникнення складної поведінки та біологічної еволюції. Далі описується система Swarm AI, навчена за допомогою модифікованого глибокого навчання з підкріпленням та еволюційної оптимізації, і демонструються симуляції пошуку по сітці, самовідновлюваного ланцюга ретрансляторів зв’язку та трьох типів скоординованої автономної атаки рою.
Як ви можете навчити собаку
Приклад навчання собаки приносити предмет пояснює базовий цикл навчання з підкріпленням. Агент спостерігає середовище, обирає дію та отримує винагороду за бажану поведінку, поступово навчаючись вибирати дії, які приводять до успіху.
Глибокий RL
Глибоке навчання з підкріпленням використовує той самий принцип, але політика агента представлена штучною нейронною мережею. Інформація про стан і сенсори перетворюється на дії, а числові винагороди спрямовують навчання до дій з вищою очікуваною майбутньою винагородою.
Deep-RL: двовимірний робот, який вчиться ходити
Двовимірний приклад Bipedal Walker демонструє глибоке навчання з підкріпленням за допомогою PPO, алгоритму типу actor-critic. Мережа політики обирає рухові дії, а модель вартості оцінює майбутню винагороду; обидві вдосконалюються через повторну взаємодію із симульованим середовищем.
Проблема багатоагентних систем
Багатоагентне навчання з підкріпленням може бути неефективним, якщо агенти винагороджуються лише за індивідуальний успіх. Аналогія з футбольною командою показує, чому навчання має заохочувати колективний результат; тут для цього використовуються формування винагороди та фактори співпраці.
Приклади моделювання штучного інтелекту Swarm
Розділ симуляцій містить п’ять прикладів: Grid Searcher, динамічний ланцюг ретрансляторів дронів і три автономні атаки рою. Вони демонструють псевдовипадковий пошук, стійкість, узгодження атак, синхронізацію та співпрацю між різними типами агентів.
Grid Searcher
Grid Searcher використовує десять простих агентів, схожих на мурах, для дослідження сітки 100 на 100 за 1000 часових кроків. Агенти мають лише локальні датчики близькості, без інформації про позицію, карти, пам’яті чи зв’язку, що навмисно ускладнює завдання.
Симуляція Grid Searcher
Попри дуже обмежені можливості, агенти Grid Searcher зазвичай охоплюють приблизно 60–70 відсотків сітки. Їхній на перший погляд безладний рух конструктивно використовує псевдовипадкову поведінку й показує, що ефективна стратегія рою не обов’язково має бути інтуїтивно зрозумілою людині.
Ретранслятори рою
Рій автономних дронів має підтримувати динамічний ланцюг зв’язку між оператором і рухомим ударним дроном. Дрони-ретранслятори повинні постійно змінювати положення в міру руху ударного дрона та одночасно компенсувати втрати від вогню противника.