Назад до презентації

Штучний інтелект рою, автономні системи та дрони

Ця презентація розглядає штучний інтелект рою для автономних і напівавтономних роботизованих систем, з особливою увагою до дронів. Вона розвиває ідею, що складна та стійка колективна поведінка може виникати завдяки співпраці відносно простих агентів ШІ, спираючись на приклади природного інтелекту рою, виникнення складної поведінки та біологічної еволюції. Далі описується система Swarm AI, навчена за допомогою модифікованого глибокого навчання з підкріпленням та еволюційної оптимізації, і демонструються симуляції пошуку по сітці, самовідновлюваного ланцюга ретрансляторів зв’язку та трьох типів скоординованої автономної атаки рою.

Показано слайди 17–24 / 34

Slide 17

Як ви можете навчити собаку

Slide 17 · 23:37

Приклад навчання собаки приносити предмет пояснює базовий цикл навчання з підкріпленням. Агент спостерігає середовище, обирає дію та отримує винагороду за бажану поведінку, поступово навчаючись вибирати дії, які приводять до успіху.

Slide 18

Глибокий RL

Slide 18 · 24:35

Глибоке навчання з підкріпленням використовує той самий принцип, але політика агента представлена штучною нейронною мережею. Інформація про стан і сенсори перетворюється на дії, а числові винагороди спрямовують навчання до дій з вищою очікуваною майбутньою винагородою.

Slide 19

Deep-RL: двовимірний робот, який вчиться ходити

Slide 19 · 25:42

Двовимірний приклад Bipedal Walker демонструє глибоке навчання з підкріпленням за допомогою PPO, алгоритму типу actor-critic. Мережа політики обирає рухові дії, а модель вартості оцінює майбутню винагороду; обидві вдосконалюються через повторну взаємодію із симульованим середовищем.

Slide 20

Проблема багатоагентних систем

Slide 20 · 28:07

Багатоагентне навчання з підкріпленням може бути неефективним, якщо агенти винагороджуються лише за індивідуальний успіх. Аналогія з футбольною командою показує, чому навчання має заохочувати колективний результат; тут для цього використовуються формування винагороди та фактори співпраці.

Slide 21

Приклади моделювання штучного інтелекту Swarm

Slide 21 · 29:46

Розділ симуляцій містить п’ять прикладів: Grid Searcher, динамічний ланцюг ретрансляторів дронів і три автономні атаки рою. Вони демонструють псевдовипадковий пошук, стійкість, узгодження атак, синхронізацію та співпрацю між різними типами агентів.

Slide 22

Grid Searcher

Slide 22 · 30:46

Grid Searcher використовує десять простих агентів, схожих на мурах, для дослідження сітки 100 на 100 за 1000 часових кроків. Агенти мають лише локальні датчики близькості, без інформації про позицію, карти, пам’яті чи зв’язку, що навмисно ускладнює завдання.

Slide 23

Симуляція Grid Searcher

Slide 23 · 32:22

Попри дуже обмежені можливості, агенти Grid Searcher зазвичай охоплюють приблизно 60–70 відсотків сітки. Їхній на перший погляд безладний рух конструктивно використовує псевдовипадкову поведінку й показує, що ефективна стратегія рою не обов’язково має бути інтуїтивно зрозумілою людині.

Slide 24

Ретранслятори рою

Slide 24 · 33:49

Рій автономних дронів має підтримувати динамічний ланцюг зв’язку між оператором і рухомим ударним дроном. Дрони-ретранслятори повинні постійно змінювати положення в міру руху ударного дрона та одночасно компенсувати втрати від вогню противника.