Архитектура, подобная новой GPT-Live, в перспективе будет использоваться на командных пунктах, в боевых машинах, на ремонтных базах и при управлении несколькими автономными платформами.
Голос неизбежно станет интерфейсом командования агентами ИИ, поскольку на войне порой все решают минуты и секунды.
Вся история военного ремесла — это оптимизация и ускорение передачи информации.
В той же OpenAI не просто так отметили, что главный смысл разработки заключается в том, что голосовая модель превращается не просто в собеседника, а в постоянно действующий интерфейс между человеком и машиной.
Такой агент сможет управлять более сложными моделями, инструментами и целыми группами других ИИ-агентов.
Военные получат не просто принципиально новый интерфейс, а именно постоянно присутствующего агента, способного координировать работу множества других боевых систем.
Важная ремарка: на практике это, конечно же, будет мультимодальная архитектура — голос, сенсорные интерфейсы, видео, жесты, тактильное управление и подтверждение команд.
Да, на войне голос крайне удобен, когда руки заняты, а решение нужно принять мгновенно, однако никто не отменяет шум, стресс, РЭБ, потерю связи, ложные команды и искажение речи.
И да, в США уже ведутся работы в этом направлении, у DARPA есть программы, посвященные именно таким системам.