looongLLaVA масштабировала мультимодальную обработку до 1000 изображений в одном контексте
Мультимодальные агенты получают более ёмкий визуальный контекст, а локальный инференс выходит в браузер. Прикладная ценность смещается к вертикальным процессам, приватному исполнению и проверяемому пониманию пользователя
🧠 Model
Тысяча изображений в контексте
looongLLaVA сочетает визуальный кодировщик, проектор и LLM для эффективной обработки до 1000 изображений
Большой визуальный контекст открывает агентам работу с архивами документов, интерфейсами и длинными последовательностями наблюдений
Модели понимают убеждения
Исследование сообщает, что LLM достигли уровня взрослых людей в задачах на рекурсивное понимание мыслей и эмоциональных состояний других людей
Такие способности полезны для персональных и переговорных агентов, но требуют сценарных evals против манипуляции и ложного приписывания намерений
🔧 Tools
Локальный агентный контур
AnythingLLM объединяет local-first исполнение, работу с данными и агентные функции в самостоятельной среде
Self-hosted контур уменьшает зависимость от внешних провайдеров и сохраняет контроль над корпоративным контекстом и памятью
🏗 Infrastructure
LLM работает в браузере
Пример Google MediaPipe запускает через JavaScript локальную генерацию текста, поиск, подготовку писем и суммаризацию документов
Браузерный инференс снижает задержку и передачу данных в облако, расширяя возможности приватных и автономных агентов
Агенты обрабатывают страхование
Waystar применяет agentic AI к страховым требованиям, отказам в выплатах и сопроводительной документации
Вертикальный сценарий показывает ценность агентов, связывающих документы, отраслевые правила и многоэтапное операционное исполнение