Новые исследования в медицинских и робототехнических LLM
Медицинские крупные языковые модели (LLM) всё чаще тренируются на смеси учебных и клинических данных, но их влияние на разные типы задач остаётся неясным. Исследователи из arXiv cs.AI провели эксперименты с изменением соотношения учебных и клинических данных и обнаружили асимметрию: клинические данные значительно улучшают клинические задачи, но остаются конкурентоспособными в задачах, требующих глубоких знаний, в то время как учебные данные эффективны лишь для знаний, но не для клинического мышления. Ошибки показывают «разрыв между знанием и действием» — улучшение в запоминании не гарантирует улучшение в клиническом рассуждении. Также выяснилось, что даже небольшое количество клинических данных даёт максимальную пользу для задач, основанных на электронных медицинских картах (EHR), а оптимальное соотношение зависит от конкретных требований задачи.
Инновации в доступности и мобильности для людей с нарушениями зрения
Учёные представили дешёвую (88 долларов США) и полностью автономную AI-интегрированную трость для людей с нарушениями зрения, работающую на Raspberry Pi Zero 2W. Устройство объединяет RGB-видеосенсоры и сенсоры времени полёта (ToF) для оценки расстояния, используя INT8-квантованную модель SSD MobileNet V1. Система обеспечивает вибрационную и аудио-подсказку, а также многопроцессорную архитектуру для надёжной работы на ограниченной мощности. В экспериментах на внутренних сценариях она показала F1-метрику 0.82, задержку 330 мс и пиковый расход 2.8 Вт. Предварительное исследование удобства использования подтвердило её практическую применимость в реальных условиях.
Искусственный интеллект и научная аудитория: влияние социального влияния
Новое исследование в arXiv cs.AI показало, как социальное влияние влияет на распределение научного внимания среди AI-агентов. В эксперименте с 1000 агентов, выбирающих статьи из American Economic Review 2025, сообщается, что при наличии социального влияния агенты выбирают на 17,2% меньше статей, но концентрируются на меньшем числе, что снижает общую разнообразность. В другом эксперименте с 200 агентами в 20 сообществах показано, что социальное влияние усиливает межгрупповую вариацию. Эти результаты подтверждают, что даже в искусственных системах социальное влияние может формировать «моды» в выборе научных публикаций.
Моделирование 3D-биофизических свойств клеток из 2D-изображений
Учёные разработали метод, позволяющий восстанавливать 3D-биофизические свойства клеток (объём, распределение, гемоглобин) на основе только 2D-изображений и статистики популяции. Модель использует совместное локальное прогнозирование, структурированный декодер для объёма и гемоглобина, обучаемые веса для отдельных клеток и калибровку под конкретное оборудование. На 390 образцах и 1105 съёмках из шести устройств модель достигла корреляций 0.86–0.98 с анализатором Sysmex. Это первый шаг к восстановлению 3D-биофизики без явной 3D-реконструкции.
Целевая кластеризация процессов с помощью LLM
Вместо традиционного кластерирования вариантов бизнес-процессов, исследователи предложили цельную кластеризацию: сначала определяется модель целей организации, затем каждый процесс преобразуется в текстовую сценарную запись, а LLM интерпретирует её в контексте целей и назначает категорию. Этот подход позволяет автоматически связывать поведение процесса с бизнес-целями. Метод был протестирован на трёх публичных наборах данных различной сложности, и показал высокую точность в автоматическом сопоставлении процессов с бизнес-категориями.
Делегирование и обсуждение: улучшение решений через коллективный разум
Исследование показало, что даже LLM могут улучшать решения через коллективное обсуждение. В экспериментах с тремя семействами моделей и четырьмя областями (визуальная оценка, рецензирование статей, обнаружение угроз, прогнозирование спорта) было показано, что среднее ошибочное решение группы после обсуждения лучше, чем у отдельных участников. Даже индивидуальные оценки становятся точнее после обсуждения. Это подтверждает, что «мудрость коллектива» работает и в искусственных системах, особенно при наличии обсуждения.
Ошибки LLM-судей: зависимость и недостаточная надёжность консенсуса
Исследование показало, что ошибки LLM-судей не являются независимыми — они часто совпадают. В группе из 10 моделей средняя корреляция ошибок между парами составила 0.21, что означает, что группа даёт статистическую информацию, эквивалентную лишь 3.5 независимым судьям. У моделей высокой точности корреляция ещё выше — до 28% случаев, когда игнорирование совпадающих ошибок приводит к ложным выводам о превосходстве системы. Это указывает на необходимость учёта зависимостей при оценке консенсуса и выборе методов голосования.
Новый датасет для международного права: IntLawNER
Учёные представили IntLawNER — первый датасет для распознавания именованных сущностей в международном праве. Он включает 2987 аннотированных предложений и 8094 сущностных спанов из решений ICJ, резолюций Совета Безопасности ООН и решений Европейского суда по правам человека. Датасет охватывает семь типов сущностей, специфичных для международного права. При этом, несмотря на высокий показатель Cohen’s kappa (0.964), при учёте пропущенных сущностей и ошибок границ F1-метрика падает до 0.753 — что показывает, что метрики, основанные на совпадении границ, могут быть обманчивыми в специализированных областях.
Повышение доверия в корпоративных ассистентах: EvidenT
EvidenT — новый лёгкий пайплайн, который проверяет извлечённые доказательства перед генерацией ответа, не требуя переподготовки модели. Он использует структурированное извлечение и детерминированное лексическое сопоставление для фильтрации неоправданных цитат, исправления «сдвигов цитирования» и сохранения трассировки источников. На 500 реальных корпоративных запросах EvidenT улучшил точность соответствия источнику на 29% по сравнению с базовыми методами, не цитировал неиспользованные URL и обеспечил почти полное покрытие ответа лексикой из источников.
Автоматизированное создание агентских тренировочных сред: AutoGym
AutoGym — новый фреймворк для генерации полных агентских тренировочных сред (задачи, среды, проверки) из минимального набора данных. Он включает три механизма: «blueprint-first» — определение допустимого пространства решений до создания среды; параметризация — контроль сложности и топологии задач; и генерация с проверкой. AutoGym позволяет создавать масштабируемые и адаптивные тренировочные среды, которые не требуют ручной настройки и могут быть использованы для тестирования моделей с разной сложностью.
Улучшение надёжности оценки ходьбы: GaitVista
GaitVista — новый слой надёжности для оценки ходьбы, который оценивает вклад каждого сегмента тела и кадра, используя покрытие камер, качество изображения, согласованность модалитетов и непрерывность движения. На тестах с 7 условиями (чистые и искажённые) он снизил среднюю ошибку на 27.7% для всего тела и 27.8% для нижней части тела, достигнув наименьшей ошибки в самых сложных условиях. Он также сократил разрыв с идеальным оракулом с 2.76–5.33 см до 1.11 см — что делает его подходящим для клинического применения.
Эффективное разбиение страниц: MSBD
MSBD — новый подход к разбиению потоков страниц (например, сканированных писем или PDF) на отдельные документы с помощью одного вызова LLM. В отличие от традиционных методов, которые разбивают по одному разделу за вызов, MSBD предсказывает несколько разделов в одном вызове, что снижает количество запросов. Эксперименты показали, что MSBD даёт лучшую эффективность-точность компромисс, но при слишком больших окнах наблюдается резкое падение точности — что указывает на необходимость адаптации под конкретные модели и коллекции.
Выбор ввода для мультимодальных систем: текст или изображение?
Исследование показало, что выбор ввода (текст, изображение или оба) существенно влияет на производительность мультимодальных систем. При одинаковых пайплайнах и моделях, изображения показывают лучшую точность на коротких документах, но с растущей задержкой и стоимостью при увеличении длины. Текст и изображения отвечают на разные типы вопросов — на 19–25% вопросов правильный ответ даёт только один из них. Лёгкий роутер на основе TF-IDF, читающий только вопрос, улучшает точность на 2.6 пункта и снижает задержку на 30% по сравнению с всегда-визуальным подходом.
Самоорганизующиеся команды агентов: SAT
SAT — новый подход к организации работы команд AI-агентов, где агенты учатся из предыдущих взаимодействий, как распределять роли, фазы обсуждения, участие и поток информации. Это позволяет им совместно рассуждать, исправлять и синтезировать частичные решения, которые ни один агент не мог бы создать самостоятельно. На 5 математических и физических задачах SAT показал 66.7% точности, что на 18.9% выше, чем у самого сильного агента, и на 9.9% выше, чем у среднего агента.
Моделирование поведения: гибридная система целей и привычек
Учёные разработали гибридную систему управления поведением, объединяющую целенаправленное и привычное поведение. Целенаправленный контроллер использует модель мира для оценки последствий действий, а привычный контроллер — вызывает действия из памяти привычек. Арбитр динамически балансирует влияние обеих систем в зависимости от состояния агента. Эта система позволяет воссоздавать разнообразные человеческие поведенческие инструкции в 3D-средах, что важно для создания более реалистичных агентов.
Аудит и калибровка моделей для прогнозирования тяжести аварий
Исследование предлагает подход к прогнозированию тяжести аварий, связанных с деменцией, который включает не только классификацию, но и контроль утечек, калибровку уверенности и сохранение всех прогнозов для аудита. На 4781 записи аварий из Техаса лучший результат дал модель Gemma с контролем утечек, показав F1 0.545. Калиброванный фьюжн-модель показал F1 0.522 и ошибку калибровки 0.033. Селективное откладывание (deferral) улучшает результаты в тех случаях, которые остаются для автоматической оценки.
Линейная гипотеза представлений: формализация и проблемы
Исследование проанализировало, почему «линейная гипотеза представлений» (LRH) в разных областях не всегда рассматривается как проверяемая гипотеза. Авторы предложили строгое формальное определение, которое делает зависимость от модели, локации представления, определения признаков и набора данных явной. Это позволяет оценивать LRH как научную гипотезу. Также выявлены открытые проблемы, требующие дальнейшего изучения, включая влияние линейных представлений на обучение и обобщение.
Построение надёжных бенчмарков для психического здоровья на Bluesky
Учёные представили систему для построения и оценки бенчмарков по распознаванию суицидальных идей и психического здоровья на Bluesky — децентрализованной платформе. Система использует публичный поток данных, фильтрацию по лексикону, Llama-3-8B для аннотации, человеческую проверку и оценку моделей. Были построены два корпуса: 8346 постов по суицидальным идеям и 9988 по психическому здоровью. На них показали, что BERT+LSTM — лучший для суицидальных идей, RoBERTa — для теста на отдельных данных, а DistilRoBERTa — для психического здоровья.
Коротко
- Медицинские LLM показали асимметрию: клинические данные лучше для клинических задач, учебные — для знаний, но не для клинического мышления.
- Дешёвая AI-трость на Raspberry Pi Zero 2W с F1 0.82 и задержкой 330 мс — доступная помощь для людей с нарушениями зрения.
- Социальное влияние снижает разнообразие выбора научных публикаций, но усиливает межгрупповую вариацию.
- Из 2D-изображений и статистики можно восстанавливать 3D-биофизику клеток с высокой корреляцией (0.86–0.98).
- LLM могут кластеризовать процессы по бизнес-целям, а не по структуре — что упрощает анализ.
- Коллективное обсуждение LLM улучшает решения — даже в задачах с высокой ответственностью.
- Ошибки LLM-судей не независимы — консенсус менее надёжен, чем кажется.
- IntLawNER — первый датасет для международного права, но метрики могут быть обманчивыми.
- EvidenT повышает доверие в корпоративных ассистентах, улучшая точность цитирования на 29%.
- AutoGym автоматизирует создание тренировочных сред для агентов, сохраняя гибкость и масштабируемость.