Trend Radar

INFRA · DAILY · 31 АВГУСТА

looongLLaVA масштабировала мультимодальную обработку до 1000 изображений в одном контексте

looongLLaVA масштабировала мультимодальную обработку до 1000 изображений в одном контексте

Мультимодальные агенты получают более ёмкий визуальный контекст, а локальный инференс выходит в браузер. Прикладная ценность смещается к вертикальным процессам, приватному исполнению и проверяемому пониманию пользователя

🧠 Model

Тысяча изображений в контексте

looongLLaVA сочетает визуальный кодировщик, проектор и LLM для эффективной обработки до 1000 изображений

Большой визуальный контекст открывает агентам работу с архивами документов, интерфейсами и длинными последовательностями наблюдений

arxiv.org

Модели понимают убеждения

Исследование сообщает, что LLM достигли уровня взрослых людей в задачах на рекурсивное понимание мыслей и эмоциональных состояний других людей

Такие способности полезны для персональных и переговорных агентов, но требуют сценарных evals против манипуляции и ложного приписывания намерений

arxiv.org

🔧 Tools

Локальный агентный контур

AnythingLLM объединяет local-first исполнение, работу с данными и агентные функции в самостоятельной среде

Self-hosted контур уменьшает зависимость от внешних провайдеров и сохраняет контроль над корпоративным контекстом и памятью

github.com

🏗 Infrastructure

LLM работает в браузере

Пример Google MediaPipe запускает через JavaScript локальную генерацию текста, поиск, подготовку писем и суммаризацию документов

Браузерный инференс снижает задержку и передачу данных в облако, расширяя возможности приватных и автономных агентов

github.com

Агенты обрабатывают страхование

Waystar применяет agentic AI к страховым требованиям, отказам в выплатах и сопроводительной документации

Вертикальный сценарий показывает ценность агентов, связывающих документы, отраслевые правила и многоэтапное операционное исполнение

thenextweb.com

ПоделитьсяTelegramX
Ещё из Infra