NVIDIA предлагает TensorRT-Edge-LLM — лёгкий движок на C++ для инференса языковых и мультимодальных моделей в физических ИИ-системах
Подборка связывает мультимодальных агентов с двумя задачами: пониманием нескольких визуальных наблюдений и эффективным исполнением на периферийном оборудовании. Большинство ссылок описывает существующие инструменты и исследования, а не подтверждённые релизы 4 октября
🧠 Model
Пространственное понимание Imagine3D
Imagine3D-LLM рассматривает проблему объединения изображений с разных ракурсов в согласованное трёхмерное представление мультимодальной моделью
Для агентов с камерами следует отдельно тестировать согласованность между ракурсами, не считая понимание одного изображения достаточным
Проверка визуальных указаний
Исследование прагматической компетентности мультимодальных моделей проверяет понимание языковых ссылок на абстрактные изображения, включая цветовые пятна и сетки
Такие задания полезны для выявления ошибок выбора визуального объекта перед предоставлением агенту права действовать
🔧 Tools
Готовая платформа AnythingLLM
AnythingLLM объединяет локальные и облачные модели, загрузку документов, агентов, многопользовательский доступ и векторные базы
Платформа даёт ориентир для сравнения готовых возможностей с собственной инфраструктурой без предположения о новом релизе
🏗 Infrastructure
Периферийный инференс NVIDIA
TensorRT-Edge-LLM описан как лёгкое высокопроизводительное ПО на C++ для инференса LLM и VLM в физических ИИ-системах
Движок стоит рассмотреть для локальных мультимодальных агентов, отдельно проверив поддерживаемое оборудование, модели и задержки
Оптимизация обслуживания моделей
Подборка исследований инференса включает аппаратные бенчмарки и архитектуру мультимодального обслуживания с независимым распределением ресурсов
Эти материалы полезны для проектирования измерений задержки и загрузки отдельных этапов обработки агентных запросов