Исследования и достижения — arambolsu-ai

Новости Тема

Исследования и достижения

Научная сторона: препринты и результаты, где заявлен новый рекорд, метод или неожиданный вывод.

Свежий выпуск · 3 октября, 13:11 · за последние 24 ч · историй: 3 · источники: arXiv cs.LG

Новые методы анализа данных в фармакогеномике и оптимизации нейросетей

В последние часы научное сообщество обновило ряд ключевых исследований в области машинного обучения и биоинформатики. В частности, ученые предложили новый подход к анализу ответов раковых клеток на лекарства, применив обратную теорию ответа на предметы (reverse Item Response Theory) — метод, обычно используемый в психометрии, но теперь адаптированный для фармакогеномики. Модель, описанная в работе, рассматривает типы рака как «субъекты» с уровнем устойчивости, а лекарства — как «объекты» с уровнем сложности преодоления. Применение к базе данных GDSC2, содержащей 242 036 измерений чувствительности, позволило оценить скрытые характеристики устойчивости к раку и активности препаратов на единой шкале. Проверка на различных режимах пропусков показала, что обратная IRT демонстрирует лучшее восстановление полной латентной ранжировки по сравнению с простым усреднением — с показателем Delta-rho +0.089 до +0.095 при 60% пропусков. Валидация с использованием Brier score подтвердила, что IRT достигает наилучшего результата среди пяти методов. Бутстрэп-доверительные интервалы показали стабильность классификации для 19 из 28 типов рака. Репликация на платформе PRISM дала 82% согласия по направлению, но слабую корреляцию по ранжировке (rho = 0.25), что указывает на методологическую надежность, а не на создание универсального клинического рейтинга устойчивости.

Оптимизатор Adam: как он отличается от градиента Натуры

Новое исследование на arXiv исследует геометрическое расхождение между широко используемым оптимизатором Adam и методом градиента Натуры (Natural Gradient Descent). Авторы проанализировали полную форму обновления Adam, включая моментум, и выявили, что он представляет собой приближение эмпирического Фишера с диагональной триммировкой, заменой меток и временной задержкой. С использованием масштабно-инвариантного метрики γ(Δθ) исследователи измерили геометрическое расхождение Adam от истинного NGD на четырех типах лосс-ландшафтов: хорошо сбалансированная линейная регрессия, плохо сбалансированная, логистическая регрессия и малая нелинейная сеть. Расхождение зависит от контекста: в хорошо сбалансированных задачах оно минимально, но растет при плохой условиях, достигая значений порядка 10³ в нейросетях. Интересно, что хотя геометрическое отклонение коррелирует с медленным началом оптимизации, оно не влияет на конечный минимум целевой функции — Adam всегда достигает низкого уровня потерь. Кроме того, улучшенный эмпирический Фишер (iEF) показал более стабильные траектории по сравнению с базовым EF, который часто колеблется или дивергирует.

Фильтры в аттеншн-моделях: как они влияют на эффективность

Новое исследование посвящено анализу фильтров в аттеншн-моделях, в частности, в контексте частотного сжатия внимания (frequency-collapse attention). Авторы проверили пять гипотез о свойствах фильтров — подавление постоянной составляющей (DC), подавление частоты Найквиста, ширина полосы, центральная частота и мульти-масштабное покрытие — на основе контролируемого аблирования в моделировании на уровне символов (TinyShakespeare, 6-слой GPT). Основные выводы: подавление DC и Найквиста оказывается вредным (эквивалентно случайной фазе), что подтверждает необходимость осциллирующей полосовой структуры, а не просто низкодименсионального спектрального резюме. Оптимальная ширина полосы — примерно 2 бина, центрированная на масштабе абзаца (~70 токенов), дает прирост в 1.15 натов по сравнению с базовым dot-product attention. Адмиссивные фильтры (с нулевым средним, форма Mexican Hat DOG с m=2) превосходят неадмиссивные гауссианы и частично защищают от билиатерального утечки FFT. Утечка FFT монотонно растет с увеличением спектрального покрытия — что указывает на важность баланса между покрытием и фильтрацией.

Коротко

  • Новая модель на основе обратной IRT улучшает ранжирование лекарств по чувствительности рака, особенно при пропусках данных, и показала стабильность для 19 типов рака.
  • Оптимизатор Adam, несмотря на геометрическое отклонение от градиента Натуры (до 10³ в нелинейных сетях), эффективно минимизирует потери и остается надежным в сложных условиях.
  • В аттеншн-моделях оптимальные фильтры — это адмиссивные, с центром на масштабе абзаца (~70 токенов), с шириной 2 бина, что дает +1.15 натов по сравнению с базовым вниманием.
  • Результаты исследований подчеркивают методологическую надежность, а не универсальность решений — особенно в биомедицинских и сложных оптимизационных задачах.

Что где прочитали

  • arXiv cs.LG: Reverse Item Response Theory for Sparsity-Robust Ranking in Fragmented Cancer Drug-Response Matrices
  • arXiv cs.LG: How Far is Adam from Natural Gradient Descent?
  • arXiv cs.LG: FourierQK: Filter Shape, Admissibility and the Leakage-Coverage Law

Прошлые выпуски

Всего выпусков: 23 · страница 3 из 3

Новые методы анализа данных и верификации в AI 23 сентября, 21:56 · историй: 18
За 24 ч · источники: arXiv cs.AI

Новые методы анализа данных и верификации в AI

В последние часы сообщество искусственного интеллекта представило ряд исследований, затрагивающих фундаментальные вопросы надежности, эффективности и применения нейросетей. Ключевые работы сосредоточены на проблемах зависимости ошибок при консенсусном судействе, новых подходах к обучению агентов через симуляции и методах повышения доверия к корпоративным ассистентам.

Надежность консенсуса и оценка моделей

Исследование, опубликованное в arXiv cs.AI, ставит под сомнение надежность использования консенсуса между LLM-судьями как доказательства корректности решений. Авторы показывают, что ошибки таких моделей сильно коррелируют, даже если они обучались на разных данных. В среднем по набору из десяти судей pairwise-корреляция ошибок составляет 0.21, что означает, что их коллективный вердикт статистически эквивалентен решению всего 3.5 независимых судей. Это особенно критично для моделей высшего уровня (frontier), где игнорирование общих ошибок может привести к ложным выводам о превосходстве одной системы над другой в 28% случаев.

Другая работа исследует феномен «мудрости коллектива» в контексте больших языковых моделей. Адаптировав трехэтапный парадигмальный подход к deliberation (совещательному обсуждению), исследователи обнаружили, что усреднение консенсусных оценок небольших групп LLM превосходит пассивное агрегирование независимых ответов. Этот эффект наблюдается в задачах от визуальной оценки чисел до прогнозирования спортивных событий, причем индивидуальные суждения моделей также становятся точнее после обсуждения.

Обучение агентов и процесс-ориентированный подход

Для решения проблемы ручного создания сред обучения (gym) для агентов представлен фреймворк AutoGym. Он генерирует полные наборы задач, исполняемые среды и верификаторы на основе минимального семени домена. Ключевая инновация — принцип «blueprint-first», при котором пространство допустимых решений и критерии верификации определяются до создания самой среды, что делает решаемость задачи обязательным условием конструкции, а не постфактум свойством.

В области управления трафиком предложен метод ProcessLight, который применяет процессное обучение к LLM. Вместо оптимизации только по конечному результату, система разбивает решения на верифицируемые семантические шаги и использует метод STeP-PO для назначения кредитов на уровне каждого шага. Это позволяет модели обучаться эффективному рассуждению, отличая валидные шаги от ошибочных, что улучшает качество управления светофорами.

Прикладные задачи: медицина, документы и физика

В медицинской диагностике представлены два значимых инструмента. Система EvidenT решает проблему «дрейфа цитирования» в RAG-системах для корпоративных ассистентов, используя детерминированное лексическое выравнивание для проверки извлеченных доказательств перед генерацией ответа. Это повышает точность попадания в источник на 29% и исключает ссылки на несуществующие URL. В то же время, GaitVista предлагает слой измерений, учитывающий надежность данных для оценки походки. Система динамически взвешивает визуальные вклады от камер и датчиков, снижая ошибку измерения на 27.7% по сравнению с базовыми методами, что важно для долгосрочного мониторинга реабилитации.

В работе с документами исследуется эффективность различных входных представлений. Эксперименты показывают, что хотя изображения страниц точнее текста в задачах QA, они требуют больше времени и ресурсов при увеличении длины документа. Ни один из форматов не покрывает все случаи ошибок, поэтому легковесный маршрутизатор на основе TF-IDF, выбирающий между текстом и изображением в зависимости от вопроса, улучшает точность на 2.6 балла и сокращает задержку на 30%. Также предложен метод Multi-Split Boundary Decision (MSBD) для сегментации потоков страниц, который предсказывает несколько границ документов за один вызов модели, значительно экономя вычислительные ресурсы при сохранении точности.

Фундаментальные исследования и новые архитектуры

Теоретический обзор формулирует более строгую формализацию «гипотезы линейного представления» (LRH), подчеркивая необходимость четкого определения модели, места представления и набора данных для проверки гипотезы как фальсифицируемого научного утверждения.

В прикладной физике модель Hapi, основанная на архитектуре U-Net Swin Transformer, обеспечивает среднесрочное гидрологическое прогнозирование на континентальном уровне (США) с разрешением 0.05 градусов. Она превосходит физические модели и другие AI-подходы в обнаружении наводнений, прогнозируя сток и влажность почвы на 24–72 часа вперед.

Также представлен бенчмарк ISA-Bench для оценки вычислительного рассуждения моделей в условиях ограниченных наборов инструкций. Исследование выявило разрыв между способностью модели находить вычислительную стратегию и возможностью выразить её в виде правильной программы на целевом наборе инструкций, что остается основной проблемой для кодогенерации в нестандартных средах.

Коротко

  • Консенсус LLM-судей часто переоценивает достоверность решений из-за высокой корреляции ошибок, снижая статистическую значимость коллективного вердикта.
  • Deliberation (совещательное обсуждение) между группами LLM повышает точность индивидуальных оценок и снижает коллективную ошибку в разнообразных задачах.
  • Фреймворк AutoGym позволяет автоматически генерировать проверяемые среды обучения для агентов, определяя критерии успеха до создания самой среды.
  • Система EvidenT устраняет дрейф цитирования в корпоративных RAG-системах, повышая точность ссылок на источники на 29%.
  • Модель Hapi обеспечивает точное прогнозирование наводнений на территории США, превосходя физические модели в воспроизведении суточного стока.
Новые исследования в медицинских и робототехнических LLM 23 сентября, 15:54 · историй: 18
За 24 ч · источники: arXiv cs.AI

Новые исследования в медицинских и робототехнических LLM

Медицинские крупные языковые модели (LLM) всё чаще тренируются на смеси учебных и клинических данных, но их влияние на разные типы задач остаётся неясным. Исследователи из arXiv cs.AI провели эксперименты с изменением соотношения учебных и клинических данных и обнаружили асимметрию: клинические данные значительно улучшают клинические задачи, но остаются конкурентоспособными в задачах, требующих глубоких знаний, в то время как учебные данные эффективны лишь для знаний, но не для клинического мышления. Ошибки показывают «разрыв между знанием и действием» — улучшение в запоминании не гарантирует улучшение в клиническом рассуждении. Также выяснилось, что даже небольшое количество клинических данных даёт максимальную пользу для задач, основанных на электронных медицинских картах (EHR), а оптимальное соотношение зависит от конкретных требований задачи.

Инновации в доступности и мобильности для людей с нарушениями зрения

Учёные представили дешёвую (88 долларов США) и полностью автономную AI-интегрированную трость для людей с нарушениями зрения, работающую на Raspberry Pi Zero 2W. Устройство объединяет RGB-видеосенсоры и сенсоры времени полёта (ToF) для оценки расстояния, используя INT8-квантованную модель SSD MobileNet V1. Система обеспечивает вибрационную и аудио-подсказку, а также многопроцессорную архитектуру для надёжной работы на ограниченной мощности. В экспериментах на внутренних сценариях она показала F1-метрику 0.82, задержку 330 мс и пиковый расход 2.8 Вт. Предварительное исследование удобства использования подтвердило её практическую применимость в реальных условиях.

Искусственный интеллект и научная аудитория: влияние социального влияния

Новое исследование в arXiv cs.AI показало, как социальное влияние влияет на распределение научного внимания среди AI-агентов. В эксперименте с 1000 агентов, выбирающих статьи из American Economic Review 2025, сообщается, что при наличии социального влияния агенты выбирают на 17,2% меньше статей, но концентрируются на меньшем числе, что снижает общую разнообразность. В другом эксперименте с 200 агентами в 20 сообществах показано, что социальное влияние усиливает межгрупповую вариацию. Эти результаты подтверждают, что даже в искусственных системах социальное влияние может формировать «моды» в выборе научных публикаций.

Моделирование 3D-биофизических свойств клеток из 2D-изображений

Учёные разработали метод, позволяющий восстанавливать 3D-биофизические свойства клеток (объём, распределение, гемоглобин) на основе только 2D-изображений и статистики популяции. Модель использует совместное локальное прогнозирование, структурированный декодер для объёма и гемоглобина, обучаемые веса для отдельных клеток и калибровку под конкретное оборудование. На 390 образцах и 1105 съёмках из шести устройств модель достигла корреляций 0.86–0.98 с анализатором Sysmex. Это первый шаг к восстановлению 3D-биофизики без явной 3D-реконструкции.

Целевая кластеризация процессов с помощью LLM

Вместо традиционного кластерирования вариантов бизнес-процессов, исследователи предложили цельную кластеризацию: сначала определяется модель целей организации, затем каждый процесс преобразуется в текстовую сценарную запись, а LLM интерпретирует её в контексте целей и назначает категорию. Этот подход позволяет автоматически связывать поведение процесса с бизнес-целями. Метод был протестирован на трёх публичных наборах данных различной сложности, и показал высокую точность в автоматическом сопоставлении процессов с бизнес-категориями.

Делегирование и обсуждение: улучшение решений через коллективный разум

Исследование показало, что даже LLM могут улучшать решения через коллективное обсуждение. В экспериментах с тремя семействами моделей и четырьмя областями (визуальная оценка, рецензирование статей, обнаружение угроз, прогнозирование спорта) было показано, что среднее ошибочное решение группы после обсуждения лучше, чем у отдельных участников. Даже индивидуальные оценки становятся точнее после обсуждения. Это подтверждает, что «мудрость коллектива» работает и в искусственных системах, особенно при наличии обсуждения.

Ошибки LLM-судей: зависимость и недостаточная надёжность консенсуса

Исследование показало, что ошибки LLM-судей не являются независимыми — они часто совпадают. В группе из 10 моделей средняя корреляция ошибок между парами составила 0.21, что означает, что группа даёт статистическую информацию, эквивалентную лишь 3.5 независимым судьям. У моделей высокой точности корреляция ещё выше — до 28% случаев, когда игнорирование совпадающих ошибок приводит к ложным выводам о превосходстве системы. Это указывает на необходимость учёта зависимостей при оценке консенсуса и выборе методов голосования.

Новый датасет для международного права: IntLawNER

Учёные представили IntLawNER — первый датасет для распознавания именованных сущностей в международном праве. Он включает 2987 аннотированных предложений и 8094 сущностных спанов из решений ICJ, резолюций Совета Безопасности ООН и решений Европейского суда по правам человека. Датасет охватывает семь типов сущностей, специфичных для международного права. При этом, несмотря на высокий показатель Cohen’s kappa (0.964), при учёте пропущенных сущностей и ошибок границ F1-метрика падает до 0.753 — что показывает, что метрики, основанные на совпадении границ, могут быть обманчивыми в специализированных областях.

Повышение доверия в корпоративных ассистентах: EvidenT

EvidenT — новый лёгкий пайплайн, который проверяет извлечённые доказательства перед генерацией ответа, не требуя переподготовки модели. Он использует структурированное извлечение и детерминированное лексическое сопоставление для фильтрации неоправданных цитат, исправления «сдвигов цитирования» и сохранения трассировки источников. На 500 реальных корпоративных запросах EvidenT улучшил точность соответствия источнику на 29% по сравнению с базовыми методами, не цитировал неиспользованные URL и обеспечил почти полное покрытие ответа лексикой из источников.

Автоматизированное создание агентских тренировочных сред: AutoGym

AutoGym — новый фреймворк для генерации полных агентских тренировочных сред (задачи, среды, проверки) из минимального набора данных. Он включает три механизма: «blueprint-first» — определение допустимого пространства решений до создания среды; параметризация — контроль сложности и топологии задач; и генерация с проверкой. AutoGym позволяет создавать масштабируемые и адаптивные тренировочные среды, которые не требуют ручной настройки и могут быть использованы для тестирования моделей с разной сложностью.

Улучшение надёжности оценки ходьбы: GaitVista

GaitVista — новый слой надёжности для оценки ходьбы, который оценивает вклад каждого сегмента тела и кадра, используя покрытие камер, качество изображения, согласованность модалитетов и непрерывность движения. На тестах с 7 условиями (чистые и искажённые) он снизил среднюю ошибку на 27.7% для всего тела и 27.8% для нижней части тела, достигнув наименьшей ошибки в самых сложных условиях. Он также сократил разрыв с идеальным оракулом с 2.76–5.33 см до 1.11 см — что делает его подходящим для клинического применения.

Эффективное разбиение страниц: MSBD

MSBD — новый подход к разбиению потоков страниц (например, сканированных писем или PDF) на отдельные документы с помощью одного вызова LLM. В отличие от традиционных методов, которые разбивают по одному разделу за вызов, MSBD предсказывает несколько разделов в одном вызове, что снижает количество запросов. Эксперименты показали, что MSBD даёт лучшую эффективность-точность компромисс, но при слишком больших окнах наблюдается резкое падение точности — что указывает на необходимость адаптации под конкретные модели и коллекции.

Выбор ввода для мультимодальных систем: текст или изображение?

Исследование показало, что выбор ввода (текст, изображение или оба) существенно влияет на производительность мультимодальных систем. При одинаковых пайплайнах и моделях, изображения показывают лучшую точность на коротких документах, но с растущей задержкой и стоимостью при увеличении длины. Текст и изображения отвечают на разные типы вопросов — на 19–25% вопросов правильный ответ даёт только один из них. Лёгкий роутер на основе TF-IDF, читающий только вопрос, улучшает точность на 2.6 пункта и снижает задержку на 30% по сравнению с всегда-визуальным подходом.

Самоорганизующиеся команды агентов: SAT

SAT — новый подход к организации работы команд AI-агентов, где агенты учатся из предыдущих взаимодействий, как распределять роли, фазы обсуждения, участие и поток информации. Это позволяет им совместно рассуждать, исправлять и синтезировать частичные решения, которые ни один агент не мог бы создать самостоятельно. На 5 математических и физических задачах SAT показал 66.7% точности, что на 18.9% выше, чем у самого сильного агента, и на 9.9% выше, чем у среднего агента.

Моделирование поведения: гибридная система целей и привычек

Учёные разработали гибридную систему управления поведением, объединяющую целенаправленное и привычное поведение. Целенаправленный контроллер использует модель мира для оценки последствий действий, а привычный контроллер — вызывает действия из памяти привычек. Арбитр динамически балансирует влияние обеих систем в зависимости от состояния агента. Эта система позволяет воссоздавать разнообразные человеческие поведенческие инструкции в 3D-средах, что важно для создания более реалистичных агентов.

Аудит и калибровка моделей для прогнозирования тяжести аварий

Исследование предлагает подход к прогнозированию тяжести аварий, связанных с деменцией, который включает не только классификацию, но и контроль утечек, калибровку уверенности и сохранение всех прогнозов для аудита. На 4781 записи аварий из Техаса лучший результат дал модель Gemma с контролем утечек, показав F1 0.545. Калиброванный фьюжн-модель показал F1 0.522 и ошибку калибровки 0.033. Селективное откладывание (deferral) улучшает результаты в тех случаях, которые остаются для автоматической оценки.

Линейная гипотеза представлений: формализация и проблемы

Исследование проанализировало, почему «линейная гипотеза представлений» (LRH) в разных областях не всегда рассматривается как проверяемая гипотеза. Авторы предложили строгое формальное определение, которое делает зависимость от модели, локации представления, определения признаков и набора данных явной. Это позволяет оценивать LRH как научную гипотезу. Также выявлены открытые проблемы, требующие дальнейшего изучения, включая влияние линейных представлений на обучение и обобщение.

Построение надёжных бенчмарков для психического здоровья на Bluesky

Учёные представили систему для построения и оценки бенчмарков по распознаванию суицидальных идей и психического здоровья на Bluesky — децентрализованной платформе. Система использует публичный поток данных, фильтрацию по лексикону, Llama-3-8B для аннотации, человеческую проверку и оценку моделей. Были построены два корпуса: 8346 постов по суицидальным идеям и 9988 по психическому здоровью. На них показали, что BERT+LSTM — лучший для суицидальных идей, RoBERTa — для теста на отдельных данных, а DistilRoBERTa — для психического здоровья.

Коротко

  • Медицинские LLM показали асимметрию: клинические данные лучше для клинических задач, учебные — для знаний, но не для клинического мышления.
  • Дешёвая AI-трость на Raspberry Pi Zero 2W с F1 0.82 и задержкой 330 мс — доступная помощь для людей с нарушениями зрения.
  • Социальное влияние снижает разнообразие выбора научных публикаций, но усиливает межгрупповую вариацию.
  • Из 2D-изображений и статистики можно восстанавливать 3D-биофизику клеток с высокой корреляцией (0.86–0.98).
  • LLM могут кластеризовать процессы по бизнес-целям, а не по структуре — что упрощает анализ.
  • Коллективное обсуждение LLM улучшает решения — даже в задачах с высокой ответственностью.
  • Ошибки LLM-судей не независимы — консенсус менее надёжен, чем кажется.
  • IntLawNER — первый датасет для международного права, но метрики могут быть обманчивыми.
  • EvidenT повышает доверие в корпоративных ассистентах, улучшая точность цитирования на 29%.
  • AutoGym автоматизирует создание тренировочных сред для агентов, сохраняя гибкость и масштабируемость.
Новые исследования и инструменты в AI: от медицинских моделей до агентов с коллективным разумом 23 сентября, 09:51 · историй: 18
За 24 ч · источники: arXiv cs.AI

Новые исследования и инструменты в AI: от медицинских моделей до агентов с коллективным разумом

В последние часы научное сообщество обновило ряд ключевых разработок в области искусственного интеллекта — от анализа влияния типов данных на медицинские LLM до создания дешёвых инструментов для визуально impaired и автоматизированной проверки доверия в корпоративных ассистентах. В центре внимания — как данные формируют способности моделей, как агенты учатся работать сообща, и как системы становятся более прозрачными и надёжными в реальных условиях.

Как данные формируют медицинские LLM: клинические и учебные источники

Новые исследования показывают, что состав обучающих данных критически влияет на способности медицинских LLM. Как сообщает arXiv, при смешанном использовании учебных материалов (например, учебников) и клинических записей (например, электронных медицинских карт) — разные типы данных формируют разные навыки. Клинические данные улучшают задачи, требующие клинического мышления, но остаются конкурентоспособными в задачах, связанных с знанием. Учебные данные, напротив, лучше развивают знания, но не всегда переносятся на клиническое мышление — возникает «разрыв между знанием и действием». Оптимальное соотношение учебных и клинических данных зависит от конкретной задачи: для задач на основе EHR (электронных медицинских карт) достаточно небольшого количества клинических данных, чтобы получить максимальную пользу.

Инструменты для реального мира: от костылей для слепых до роботов для рек

В области прикладных решений появилось несколько инновационных систем. Учёные представили дешёвую (всего $88 USD) и полностью автономную интеллектуальную трость на базе Raspberry Pi Zero 2W, способную обнаруживать опасности и давать аудио- и вибро-подсказки. Она использует RGB-видео и ToF-датчики, а также INT8-квантованную модель SSD MobileNet V1. Второй проект — PAANI — представляет собой архитектуру для роботов, движущихся по рекам, которая объединяет детектор YOLO11n и сегментатор MobileNetV3, чтобы объединять визуальные данные и выдавать объяснимые рекомендации с указанием источников. Оба решения ориентированы на ресурсоёмкие и низкобюджетные условия.

Проверка и доверие: от агентов, которые обсуждают, до проверки источников

Вопросы надёжности и доверия в AI получили новое освещение. В работе EvidenT описана лёгкая система, которая проверяет, соответствует ли сгенерированный ответ источникам, и улучшает точность цитирования на 29% по сравнению с базовыми методами. В другом исследовании MAWILE — инструмент для аудита чувствительности оценочных систем к изменениям в запросах, критериях и ответах. Также было показано, что согласие между LLM-судьями не всегда означает правильность — ошибки часто совпадают, что снижает эффективность коллективного голосования. В одном из экспериментов ошибка между десятью судьями была эквивалентна ошибке только трёх независимых.

Коллективное мышление и агенты: от самоорганизующихся команд до генеративных систем

Новые подходы к организации работы агентов позволяют им учиться работать сообща. В SAT (Self-Organizing Agent Teams) агенты учатся распределять роли, обмениваться и синтезировать частичные решения, что позволяет им достигать точности в 66,7% по сравнению с 48,8% у самого сильного агента. Также появилась генеративная система управления поведением агентов, которая моделирует как целенаправленное, так и привычное поведение, с динамическим балансированием между ними через арбитра. В экспериментах это позволило воссоздавать человеческие поведенческие инструкции в 3D-средах.

Новые базы данных и методы: от международного права до гаит-оценки

Созданы новые ресурсы для специализированных задач. IntLawNER — первый набор для распознавания сущностей в международном праве, охватывающий решения ICJ, резолюции ООН и решения ECtHR. Он показал, что даже высокие метрики (например, Cohen’s kappa=0,964) могут маскировать реальные ошибки в NER. В области оценки гаит-движения представлена система GaitVista, которая учитывает надёжность измерений и снижает ошибки на 27,7–27,8% по сравнению с базовыми методами. Также появилась система MSBD для более эффективного разделения страниц в документах, что снижает количество вызовов к моделям и улучшает баланс между точностью и эффективностью.

Коротко

  • Состав обучающих данных в медицинских LLM критически влияет на их способности: клинические данные лучше для клинических задач, учебные — для знаний, но с разрывом между ними.
  • Новые инструменты для реального мира: дешёвая интеллектуальная трость и система для роботов на реках, работающие на низкопотребляющих платформах.
  • Доверие к AI-системам требует проверки: EvidenT и MAWILE улучшают прозрачность и надёжность оценок.
  • Агенты учатся работать сообща: SAT и генеративные системы повышают эффективность и имитируют человеческое поведение.
  • Созданы новые базы данных и методы: IntLawNER для международного права, GaitVista для оценки гаит-движения, MSBD для эффективного разделения документов.

Что где прочитали

  • arXiv cs.AI: Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models
  • arXiv cs.AI: An Affordable AI-Integrated Smart Cane for Multimodal Mobility Assistance of Visually Impaired Users
  • arXiv cs.AI: PAANI : On Device Visual Evidence Fusion and Explainable Guidance for River Robot Simulation
  • arXiv cs.AI: Social Influence and the Allocation of Scientific Attention in AI Populations
  • arXiv cs.AI: Learning 3D biophysical cell properties from 2D images and cell-population statistics
  • arXiv cs.AI: Goal-driven Variant Categorization
  • arXiv cs.AI: Replication Without Persistence in Hosted LLMs: Measurement Sensitivity in Action-Time Belief Evaluation
  • arXiv cs.AI: The Wisdom of Artificial Deliberative Crowds
  • arXiv cs.AI: Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus
  • arXiv cs.AI: IntLawNER: A Named Entity Recognition Dataset and Benchmark in International Law
  • arXiv cs.AI: EvidenT: Building Trustworthy Enterprise Assistants through Evidence Groundedness and Traceability
  • arXiv cs.AI: AutoGym: Blueprint-First Generation of Verifiable Agent Gyms
  • arXiv cs.AI: MAWILE: Multi-Axis Workbench for Inspecting LLM Evaluators
  • arXiv cs.AI: GaitVista: Reliability-Aware AI Measurement toward Accessible Longitudinal Gait Assessment
  • arXiv cs.AI: Splitting Documents at Lower Cost: Multi-Split Boundary Decisions for LLM-Based Page Stream Segmentation
  • arXiv cs.AI: Text, Pixels, or Both? Evaluating Input Representations for Multimodal Document QA
  • arXiv cs.AI: Self-Organizing Agent Teams Learn to Reason Together
  • arXiv cs.AI: Generative Embodied Multiple Behavior Control Systems for Human-like Agents
Новые методы обнаружения и улучшения работы крупных языковых моделей 23 сентября, 03:30 · историй: 18
За 24 ч · источники: arXiv cs.AI

Новые методы обнаружения и улучшения работы крупных языковых моделей

Новые исследования предлагают более точные подходы к выявлению галлюцинаций в LLM, а также методы замены внимания на более эффективные архитектуры без потери качества. В частности, ученые анализируют топологию графов внимания, чтобы выявлять структурные бутылочные шейки, связанные с галлюцинацией. Метод, основанный на измерении кривизны Forman-Ricci, позволяет эффективно отличать галлюцинированные ответы от корректных. Этот подход демонстрирует устойчивое улучшение по сравнению с существующими методами на двух стандартизированных бенчмарках, и показывает, что галлюцинации часто связаны с избыточным использованием самовнимания и размытым восстановлением контекста из ранних токенов.

Альтернативы вниманию: конверсия моделей с сохранением качества

Ученые представили TinyCeNN-LM — метод пост-обучения, позволяющий заменять внимательные слои на архитектуры с ограниченной локальной обработкой, вдохновленные CeNN. Метод использует «качественные шлюзы» — только те слои, которые проходят жесткие пороги по NLL и сохранению представлений, принимаются для замены. На SmolLM2-135M первые три слоя были приняты с незначительным ростом perplexity, а четвертый — отвергнут из-за несоответствия представлений. На Qwen3.5-0.8B были приняты слои 3, 7 и 11 с общим ростом NLL на 0.02073. Вариант Integrated Memory сокращает кэш на 6.01% и сохраняет perplexity в пределах ±0.93%, а проверка на 200 задачах показала точность 28.5–32.0%.

Проверка AI-инструментов в медицине и психиатрии

Новая платформа InterviewPlayground, основанная на памяти-усиленном симуляторе пациентов, позволяет оценивать AI-инструменты для психиатрического приема по клиническим стандартам. В пилотном тесте с участием шести врачей LLM-интервьюер (на базе GPT) восстановил 88.0% клинически значимых элементов из сценариев, но также сделал 56.8% клинических выводов, не основанных на интервью. Это указывает на необходимость более точной оценки, учитывающей не только точность, но и качество клинических инференсов. Платформа позволяет сравнивать разные стили интервью и минимизировать нагрузку на врачей.

Модели для инженерных задач: от мостов до финансового совета

Новые бенчмарки и методы позволяют оценивать способность MLLM создавать и ремонтировать конструкции. PolyBridgeBench — первый бенчмарк, который проверяет, может ли модель сгенерировать полную топологию моста, выполнить симуляцию и восстановить его после провала. Также исследуется, как AI-советы влияют на доверие пользователей: в эксперименте с 285 участниками было показано, что стиль совета (AI, эксперт, сообщество) сильнее всего влияет на восприятие безопасности и качества. Экспертный стиль остался наиболее предпочтительным даже без указания источника. В то же время, в финансовой сфере AI-советы не всегда превосходят человеческие, и доверие к ним зависит от контекста и стиля представления.

Улучшение рекомендаций, кода и прогнозов

Для рекомендаций продуктов в последовательности предложен DSRec — модель, которая разделяет интересы на долгосрочные и краткосрочные, используя SSM-энкодеры. Для кода — CodeMidas, который автоматически создает RL-среды на основе существующего кода, используя 5545 задач из 3185 репозиториев. Для прогноза цен на акции — ResNLS, гибридная модель на базе ResNet и LSTM, которая показала улучшение на 20% по сравнению с текущими методами, используя последние 5 дней данных. Также предложена модель Cal-OPD для настройки дистилляции, которая фильтрует диссонанс между учителем и учеником, улучшая качество обучения.

Методы для проверки знаний и поведения моделей

Ученые разработали PIR — метод, позволяющий определить, какие ответы модель «знает», даже если не отвечает на них. Метод использует внутренние состояния модели и показал точность 0.70–0.87, что значительно выше базовой 0.25. Также предложен RAVEL — метод онлайн-обучения для выбора вопросов в интерактивной системе, который улучшает результаты поиска за 5 раундов. В области этики — Geometry of Values, который исследует предпочтения в моральных дилеммах, показав, что даже после финального обучения Llama-3.2-1/3B достигает точности выше 98% в выборе между значениями.

Оценка взаимодействия человека и AI

Новые подходы позволяют оценивать не только результат, но и стоимость взаимодействия. В исследовании показано, что сессии с одинаковым качеством могут отличаться в 70 раз по затратам. Также выявлено, что некоторые задачи требуют долгого взаимодействия, а другие — быстрого сходства. Субъективные оценки пользователей не являются надежным заменителем продуктивности. Показано, что продуктивные сессии характеризуются более ранними запросами со стороны AI и меньшими затратами пользователей на исправление.

Коротко

  • Новые методы позволяют выявлять галлюцинации в LLM через анализ топологии внимания и кривизны графов.
  • TinyCeNN-LM предлагает безопасную замену внимания на архитектуры с ограниченной локальной обработкой, сохраняя качество.
  • Платформа InterviewPlayground позволяет оценивать AI-инструменты в психиатрии по клиническим стандартам.
  • PolyBridgeBench — первый бенчмарк для проверки способности MLLM создавать и ремонтировать мосты.
  • ResNLS и CodeMidas — новые модели для прогноза акций и генерации RL-сред для кода.
  • PIR и RAVEL — методы для проверки знаний модели и выбора вопросов в интерактивных системах.
  • Исследование показывает, что стиль совета и контекст влияют на доверие к AI-советам.
  • Взаимодействие человека и AI требует учета не только качества, но и затрат на его достижение.

Что где прочитали

  • arXiv cs.AI: Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
  • arXiv cs.AI: TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers
  • arXiv cs.AI: Clinician-Grounded Quality Assurance for AI-Assisted Psychiatric Intake
  • arXiv cs.AI: PolyBridgeBench: Benchmarking Multimodal LLMs for Physics-Grounded Bridge Design
  • arXiv cs.AI: Dual-Interest Sequential Product Recommendation With Multi-Granular SSM
  • arXiv cs.AI: Calibrating Teacher--Student Discrepancy for On-Policy Distillation
  • arXiv cs.AI: What Should We Ask Next? Retrieval-Aware Question Learning under Partial Evidence
  • arXiv cs.AI: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
  • arXiv cs.AI: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
  • arXiv cs.AI: ResNLS: An Improved Model for Stock Price Forecasting
  • arXiv cs.AI: Reinforcement learning for post-coronagraphic wavefront control
  • arXiv cs.AI: BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
  • arXiv cs.AI: SpaceDiffusion: Over-the-Orbit Diffusion for Space Generate-and-Forward Communications
  • arXiv cs.AI: Trustworthy FinAInce: Unpacking How AI-Mediated Financial Advice is Judged
  • arXiv cs.AI: Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models
  • arXiv cs.AI: From Task Success to Productive Success: Evaluating Human-AI Collaboration by Quality and Cost
  • arXiv cs.AI: The Stochastic Shift: A New Evaluation Paradigm for Text-to-SQL with AI Operators
  • arXiv cs.AI: EnSol: an environment-aware graph neural network for molecular solubility prediction
Новые методы ускорения и улучшения работы крупных языковых моделей 22 сентября, 21:25 · историй: 18
За 24 ч · источники: arXiv cs.AI

Новые методы ускорения и улучшения работы крупных языковых моделей

На архиве arXiv появилась новая архитектура внимания RBS-Attention, разработанная для ускорения предварительной обработки (prefill) в моделях с длинным контекстом. Метод, описанный в работе arXiv:2609.20971v1, использует два независимых ветвления: основную, которая оценивает среднюю релевантность блоков, и «спасательную», которая выявляет блоки, где релевантные токены могут быть упущены из-за «размывания среднего» (mean dilution). Система позволяет эффективно комбинировать маски этих ветвей, сохраняя при этом блоковую разреженность и используя FlashAttention. На H100 GPU RBS-Attention демонстрирует 20,65 раза ускорение в предварительной фазе для модели Qwen3-30B-A3B-Instruct-2507-FP8 при 128K токенах, а также 5,97 раза ускорение в общем времени до первого токена.

Улучшение логического рассуждения и обнаружение ошибок в ответах

Новые подходы направлены на улучшение логической последовательности и обнаружение фальсификаций. CaLR (Causal Latent Revision) — это фреймворк, который перестраивает процесс рассуждения как оптимизацию скрытых состояний с учетом причинной структуры, полученной от эксперта. С помощью имплицитной дифференциации и «пересмотра мыслей» CaLR обеспечивает динамическую самокоррекцию шагов, что позволяет достигать SOTA-уровня на сложных задачах, включая Sudoku. В то же время, метод LogicTrack использует формальные логические решатели для аудита цепочек рассуждений, автоматически преобразуя каждый шаг в символическую форму и проверяя его. Это позволяет не только улучшать конечные ответы, но и обучать модели внутренней способности к самопроверке через supervised fine-tuning.

Обнаружение и анализ фальсификаций в ответах моделей

Исследователи разработали метод, основанный на топологическом анализе графов внимания, для обнаружения фальсификаций в ответах LLM. В работе arXiv:2609.21096v1 используется Forman-Ricci кривизна для выявления структурных «узких мест» в потоке информации. Метод анализирует как локальные, так и глобальные характеристики внимания, связанные с фальсифицированными ответами. Эксперименты показали, что подход обеспечивает улучшение по сравнению с существующими методами на двух бенчмарках по обнаружению фальсификаций. Важно, что фальсификации часто связаны с нарушением обмена контекстом между токенами — особенно с чрезмерной зависимостью от самовнимания или расплывчатым извлечением контекста из ранних токенов.

Анализ и улучшение коммуникации структурированной информации

Новые исследования показывают, насколько эффективно структурированная информация (например, деревья выражений) сохраняется при преобразовании в естественный язык и обратно. В работе arXiv:2609.21509v2 описан «круговой протокол»: генератор создает задачу на основе арифметического выражения, а извлечатель восстанавливает выражение из текста. Оценка всех пар моделей показала, что канал передачи информации является асимметричным и потерей: точность может меняться на 60,4 пункта в зависимости от того, какая модель генерирует, а какая извлекает. Наиболее успешные пары достигают 92,9% точности, используя разные модели на разных этапах. Основная причина ошибок — структура дерева (количество операторов, глубина, правосторонняя ветвление), а не архитектура модели.

Модели для медицинских и инженерных задач

В области медицины представлена MIST — модель для прогнозирования выживаемости с использованием геномных данных и гистологии. Она представляет геномные признаки как токены и позволяет им «запрашивать» контекст из гистологических токенов, что позволяет интегрировать молекулярную информацию с изображениями без полного слияния модальностей. Модель показала улучшение C-index на четырех внешних наборах данных (кишечник, почки, легкие, глиобластома). В инженерии предложен SpaceDiffusion — диффузионный подход для коррекции искажений на орбите, позволяющий спутникам восстанавливать поврежденные данные перед передачей. В области биомедицинских интерфейсов Bio-MF предлагает быстрое и высококачественное преобразование EEG в fNIRS без необходимости предобучения, что важно для реального времени.

Улучшение агентных систем и бизнес-аналитики

AutoViewMem — система для долгосрочной памяти в агентах, которая автоматически организует информацию в независимые семантические «виды» для снижения шума при поиске. Это позволяет использовать стандартный поиск по схожести без сложных маршрутизаций. В области дизайна представлен Designer-RSI — система, которая накапливает и улучшает процедуры дизайна на основе реального опыта пользователей, не требуя пересчета весов. За пять раундов она увеличила качество генерации на Claude-Sonnet-4 с 72,7% до 99,3%. В бизнес-аналитике BI-Agent и BI-Bench — первый бенчмарк для оценки способности LLM решать задачи бизнес-аналитики «с нуля», показав, что даже передовые модели имеют точность менее 50%. BI-Agent использует инструменты для автоматизации подготовки данных.

Применение ИИ в астрономии, сельском хозяйстве и психологии

В астрономии предложен метод, использующий глубокое обучение для коррекции волнового фронта в системах с коронографами — это позволяет создавать «темные области» на изображениях, где планеты становятся видимыми. В сельском хозяйстве PlantShade — диффузионная модель для генерации теней растений, что помогает роботам планировать освещение и перемещения. В психологии исследовано, как пользователи оценивают финансовые советы, полученные от ИИ, экспертов и сообщества. Результаты показали, что стиль совета и наличие метки «эксперт» сильно влияют на доверие и намерение доверять — экспертный стиль остается предпочтительным даже без метки.

Улучшение работы агентов и их взаимодействия

Исследование Scaling Discovery through Test-Time Communication показало, что агенты, общающиеся в тестовом режиме, могут решать задачи, которые не могут решить отдельные агенты. Команда из k агентов может достигать эффективности, эквивалентной 4k агентов, и даже решать задачи, недоступные для отдельных агентов. Эти результаты переносятся на задачи с научным содержанием, где коммуникация позволяет превзойти лучшие результаты. В области рендеринга Physically Based Rendering in the Latent Space позволяет использовать физически точные методы для генерации изображений в пространстве латентных признаков, что позволяет управлять светом и сценой с минимальной ручной настройкой.

Коротко

  • RBS-Attention ускоряет предварительную обработку LLM на 20 раз, используя две ветви выбора блоков внимания.
  • CaLR и LogicTrack улучшают логическую последовательность и позволяют проверять рассуждения с помощью формальных логических решателей.
  • Методы обнаружения фальсификаций анализируют топологию внимания и выявляют нарушения в обмене контекстом.
  • Модели для коммуникации структурированной информации показали, что канал передачи неэффективен и сильно зависит от структуры данных.
  • MIST и SpaceDiffusion — новые подходы в медицине и космической связи, позволяющие интегрировать разные данные и корректировать искажения.
  • AutoViewMem и Designer-RSI улучшают долгосрочную память и автоматизацию дизайна, используя структурированные представления и опыт.
  • BI-Agent и BI-Bench — первый бенчмарк для оценки бизнес-аналитики LLM, показавший их слабые места.
  • Агенты с коммуникацией могут решать задачи, недоступные для отдельных агентов, и превзойти лучшие результаты.
  • В астрономии, сельском хозяйстве и психологии ИИ применяется для улучшения рендеринга, планирования и оценки доверия.

Что где прочитали

  • arXiv cs.AI: RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
  • arXiv cs.AI: CaLR: Causal Latent Revision for Robust Diffusion Reasoning
  • arXiv cs.AI: Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
  • arXiv cs.AI: LogicTrack: Auditing Reasoning Trajectories of Large Language Models with Formal Logic Solvers
  • arXiv cs.AI: The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models
  • arXiv cs.AI: MIST: Multimodal Survival Prediction with Genomic-Guided Histology Attention
  • arXiv cs.AI: AutoViewMem: Self-Configuring Orthogonal Views for Conversational Long-Term Memory
  • arXiv cs.AI: Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
  • arXiv cs.AI: Reinforcement learning for post-coronagraphic wavefront control
  • arXiv cs.AI: BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
  • arXiv cs.AI: SpaceDiffusion: Over-the-Orbit Diffusion for Space Generate-and-Forward Communications
  • arXiv cs.AI: Bio-MF: Low-Latency and High-Fidelity EEG-to-fNIRS Cross-Modal Generation for Hybrid Motor-Imagery Brain--Computer Interfaces
  • arXiv cs.AI: Trustworthy FinAInce: Unpacking How AI-Mediated Financial Advice is Judged
  • arXiv cs.AI: Scaling Discovery through Test-Time Communication
  • arXiv cs.AI: Physically Based Rendering in the Latent Space
  • arXiv cs.AI: How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?
  • arXiv cs.AI: PlantShade: Predicting Plant Shadows for Lighting-Aware Robotic Agricultural Operation
  • arXiv cs.AI: Aligning with Lived Experience: Heterogeneous Benefits of Fine Tuning in Mental Health Support Generation
Новые архитектуры и методы для улучшения работы ИИ в сложных задачах 22 сентября, 15:24 · историй: 18
За 24 ч · источники: arXiv cs.LG, arXiv cs.AI

Новые архитектуры и методы для улучшения работы ИИ в сложных задачах

На архиве arXiv за последние дни появилось несколько исследований, которые предлагают новые подходы к решению ключевых проблем в области ИИ: от ускорения работы крупных моделей до улучшения их адаптации к специфическим задачам. В частности, ученые представили Latent Evolution Operator Network (LEON) — архитектуру, которая моделирует эволюцию скрытых состояний в задачах робототехники, используя операторы, а не трансформеры. LEON основан на контролируемой динамической системе и позволяет сохранять информацию, важную для управления, без генерации полного визуального представления. Это решение, как отмечают авторы, улучшает точность прогнозирования сценариев взаимодействия робота с окружающей средой.

Ускорение и оптимизация работы LLM: от предварительной обработки до архитектурных изменений

Вопросы производительности при работе с длинными контекстами в LLM стали предметом активных исследований. Ученые представили RBS-Attention — метод, который ускоряет предварительную обработку запросов (prefill) за счет двух параллельных ветвей: одной, которая фокусируется на центре блока, и другой — на периферии, где могут скрываться важные токены. Этот подход, не требующий обучения, позволяет на H100 GPU достичь в 20 раз большей скорости предварительной обработки и в 5–6 раз ускорить генерацию первого токена. Также в рамках архитектурных изменений появился TinyCeNN-LM — система, которая позволяет заменять внимательные слои на более компактные и эффективные, сохраняя качество модели. На Qwen3.5-0.8B, например, удалось заменить три слоя внимания без существенного роста perplexity, а на SmolLM2-135M — с минимальным увеличением NLL.

Модели для специализированных задач: от подводного распознавания до медицинских прогнозов

Новые методы адаптации моделей к специфическим задачам включают применение LoRA для обучения Vision Transformers на данных синтетической акустической сонарной съемки (SAS) — это позволило улучшить точность распознавания целей в морской среде на 38% (AUPRC от 0.3 до 0.679). В медицине предложена модель MIST, которая использует геномные данные для улучшения прогноза выживаемости на основе гистологических изображений — в четырех разных типах опухолей она показала улучшение C-index по сравнению с традиционными методами. Также исследователи выявили проблему «ECG Mirage» — когда VLMs используют изображения ЭКГ, но не учитывают их содержание, что снижает точность прогнозов. Для решения этой проблемы предлагается обучать модели на ограниченных визуальных промптах, что позволяет улучшить качество прогнозов без изменения основной архитектуры.

Улучшение интерактивности и адаптации: от вопросов до дизайна

В области интерактивных систем появился RAVEL — метод, который обучает агентов задавать вопросы, оптимизируя их для последующего извлечения информации. Он использует обратную связь по ранжированию и показывает улучшение в пяти раундах взаимодействия. В дизайне представлен Designer-RSI — система, которая накапливает и улучшает процедуры выполнения задач на основе реальных пользовательских запросов. Без обновления весов и без человеческих меток она смогла улучшить качество генерации на Claude-Sonnet-4 с 72.7% до 99.3% и повысить победные показатели на специализированных тестах. Также в области бизнес-аналитики появился BI-Agent — агент, который автоматизирует подготовку данных и отвечает на вопросы, основываясь на реальных проектах. Он показал, что даже передовые LLM работают слабо на BI-Bench, и требует дополнительной интеграции инструментов для достижения реального результата.

Модели для сложных систем: от финансовых прогнозов до космических коммуникаций

В области финансовых прогнозов представлена модель ResNLS, которая объединяет ResNet и LSTM для анализа зависимостей между ценами акций. При использовании данных за последние 5 дней она показала улучшение на 20% по сравнению с текущими лидерами. В космической технике предложена система SpaceDiffusion — диффузионная модель, которая работает на орбите и восстанавливает поврежденные данные перед передачей. Она использует теорию коррекции искажений канала и позволяет одной модели адаптироваться к различным условиям связи. Также в области научных вычислений разработан dSTAR — метод для распределенного обучения, который устойчив к «медленным» узлам и атакам Байзантина. Он использует медиану для фильтрации градиентов и обеспечивает линейную сходимость, а также сохраняет точность даже при атаках, где другие методы теряют до 50% качества.

Методы для улучшения обучения и оценки: от калибровки до бенчмарков

В области обучения моделей предложена Cal-OPD — метод калибровки разницы между учителем и учеником, который учитывает собственные искажения учителя. Это позволяет избежать обучения на «лишней» информации и улучшить качество обучения. В области оценки эффективности Генеративного ИИ в корпоративной среде появилась система EnterpriseVal, которая позволяет оценивать не только способности модели, но и ее надежность, безопасность и экономическую ценность в конкретных сценариях. Она включает формальное описание задачи, метрики и протокол оценки, что делает возможным масштабируемую и объективную оценку. Также в области бенчмарков появился BI-Bench — первый набор тестов для оценки способности LLM к бизнес-аналитике, который показал, что даже самые передовые модели работают на уровне менее 50% — что стимулирует разработку более адаптивных агентов.

Коротко

  • LEON — новая архитектура для робототехники, которая моделирует эволюцию скрытых состояний с помощью операторов, а не трансформеров.
  • RBS-Attention и TinyCeNN-LM — методы, которые ускоряют и оптимизируют работу LLM, включая замену внимательных слоев на более эффективные.
  • LoRA и MIST — подходы для специализации моделей на подводном распознавании и медицинских прогнозах.
  • RAVEL и Designer-RSI — системы, которые улучшают интерактивность и адаптацию моделей к задачам.
  • ResNLS, SpaceDiffusion и dSTAR — модели для финансовых прогнозов, космической связи и распределенного обучения.
  • Cal-OPD и EnterpriseVal — методы для калибровки обучения и оценки бизнес-ценности Генеративного ИИ.
  • BI-Bench — первый бенчмарк для оценки LLM в бизнес-аналитике, показавший их слабые места.

Что где прочитали

  • arXiv cs.LG: Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models
  • arXiv cs.AI: RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
  • arXiv cs.AI: LoRA Enhanced Contrastive Learning with SAS Vision Transformers
  • arXiv cs.AI: TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers
  • arXiv cs.AI: The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models
  • arXiv cs.AI: Calibrating Teacher--Student Discrepancy for On-Policy Distillation
  • arXiv cs.AI: World Modeling in Transformers
  • arXiv cs.AI: ECG Mirage: Revealing and Mitigating the Underutilisation of ECGs in Vision-Language Models for Clinical Prediction
  • arXiv cs.AI: MIST: Multimodal Survival Prediction with Genomic-Guided Histology Attention
  • arXiv cs.AI: EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise
  • arXiv cs.AI: What Should We Ask Next? Retrieval-Aware Question Learning under Partial Evidence
  • arXiv cs.AI: Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
  • arXiv cs.AI: ResNLS: An Improved Model for Stock Price Forecasting
  • arXiv cs.AI: dSTAR: Straggler Tolerant and Byzantine Resilient Distributed SGD
  • arXiv cs.AI: A Hybrid Computational Intelligence Framework for scRNA-seq Imputation: Integrating scRecover and Random Forests
  • arXiv cs.AI: Reinforcement learning for post-coronagraphic wavefront control
  • arXiv cs.AI: BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
  • arXiv cs.AI: SpaceDiffusion: Over-the-Orbit Diffusion for Space Generate-and-Forward Communications
Ускорение и умение мыслить: новые подходы к работе с LLM и их тестированию 22 сентября, 09:23 · историй: 18
За 24 ч · источники: arXiv cs.AI

Ускорение и умение мыслить: новые подходы к работе с LLM и их тестированию

В последние дни научное сообщество представило ряд инноваций, направленных на оптимизацию работы больших языковых моделей, улучшение их способности к логическому мышлению и оценке их поведения в реальных задачах. Среди них — методы, позволяющие значительно ускорить предварительную обработку запросов, новые подходы к аудиту логики, а также инструменты для оценки человеческого и машинного мышления, а также для проверки физической корректности проектов. Всё это демонстрирует, как быстро развивается инфраструктура, поддерживающая и расширяющую возможности LLM.

Ускорение предварительной обработки: RBS-Attention и его преимущества

Новый метод RBS-Attention, описанный в arXiv, позволяет значительно сократить время предварительной обработки (prefill) длинных контекстов в LLM. Он использует два параллельных ветвления: одну для вычисления среднего значения релевантности блоков, другую — для выявления блоков, где ключевые токены могут быть упущены из-за «размытия среднего». Этот подход, не требующий обучения, позволяет на H100 GPU достичь 20,65 раз ускорения в предварительной аттеншн-обработке для модели Qwen3-30B-A3B-Instruct-2507-FP8 при 128K токенов, а также 5,97 раз ускорения в общем времени до первого токена. Для плотной модели Qwen3-32B точность RULER оценивается на уровне 88,65 против 89,52 у плотного аналога — что говорит о сохранении качества при ускорении.

Логика и аудит: от проверки шагов до обучения на аудите

Новые методы позволяют не только оценивать, но и аудировать логические шаги LLM. LogicTrack, представленный в arXiv, автоматически формализует каждый шаг мышления и проверяет его с помощью автоматических теорематических доказателей. Это позволяет выявлять логически несостоятельные шаги, даже если конечный ответ верен. Система использует Solver-Based Backtracking Reward (SBR) для оценки и корректировки шагов, а также может генерировать данные для fine-tuning, чтобы модели учились аудитировать свои собственные шаги. В экспериментах на 8 бенчмарках и 7 моделях показано, что LogicTrack улучшает как верифицируемость, так и конечные результаты.

Оценка и сравнение: от человеческого мышления до физических конструкций

Системы сравнения человеческого и машинного мышления получили развитие. CogGym, представленный в arXiv, предлагает унифицированную платформу для масштабного сравнения ответов моделей и людей на когнитивных задачах. Он использует полуавтоматизированный процесс, основанный на участии человека, для стандартизации экспериментов в формате EML. На 258 экспериментов из 100 статей, оцениваемых 50 моделями, выявлено, что более крупные и свежие модели лучше воспроизводят человеческие суждения. Однако, как показывает анализ, модели всё ещё систематически отклоняются от человеческого мышления в определённых областях.

Физика и инженерия: от размещения микросхем до мостов

В области физического дизайна и инженерии появился PlaceReasoner-Beta — многоагентная система, которая рассматривает размещение макросов в VLSI как замкнутый цикл логического рассуждения, а не как оптимизацию. Она использует VLM для генерации кандидатов, геометрические и физические верификаторы для проверки, а также оптимизаторы для улучшения. Для оценки введён PlaceReasoner-Bench — открытый бенчмарк на основе открытых RTL-дизайнов и EDA-инструментов. В области мостов представлена PolyBridgeBench — бенчмарк, который оценивает не только структурную корректность, но и способность моделей восстанавливать мосты после провала в симуляции. Эксперименты показали значительный разрыв между моделями и человеческими способностями в этом аспекте.

Эффективность и адаптация: от производственных агентов до биометрии

В производственной среде исследователи изучили эффективные методы повторного тестирования агентов. В arXiv описано, что адаптивное тестирование с использованием 2PL-модели позволяет получить 200 вопросов вместо полного 574-элементного теста, с ошибкой в 1,03 pp MAE. Вместо этого в производстве использовали стратифицированные фиксированные подмножества, которые легко масштабируются и переносятся на другие агенты. В области биометрии ECG-биометрия была протестирована в условиях физической нагрузки и временной вариации. Используя Siamese ResNet с поздней мульти-канальной фьюзинг-стратегией, достигнута точность EER 1,7% в рамках сессии и 3,9% на CYBHi — лучший результат в этой области.

Проверка знаний и скрытая информация: от ложных ответов до внутреннего распознавания

Новые методы позволяют выявлять, какие знания модель скрывает. В arXiv представлен метод Probe of Internal Recognition (PIR), который анализирует внутренние состояния модели при предъявлении вопроса с вариантами ответов, чтобы определить, какой ответ модель «знает». Метод работает без внешних эталонов и показывает точность от 0,70 до 0,87, что значительно выше шансов (0,25) и базовой модели (0,28–0,40). Он эффективен даже при преднамеренной ложной информации, обучении на «замаскированных» ответах и других формах скрытия. Это открывает возможность для более глубокого понимания, что модель действительно знает, а что — нет.

Коротко

  • RBS-Attention ускоряет предварительную обработку LLM в 20 раз, сохраняя качество.
  • LogicTrack позволяет аудитировать логику LLM и обучать их на аудите.
  • CogGym масштабирует сравнение человеческого и машинного мышления.
  • PolyBridgeBench и PlaceReasoner-Beta оценивают физическую корректность и размещение.
  • Эффективные методы тестирования агентов и ECG-биометрия в условиях нагрузки.
  • PIR позволяет выявлять скрытые знания моделей без внешних эталонов.

Что где прочитали

  • arXiv cs.AI: RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
  • arXiv cs.AI: A Fully Differentiable Neuro-Soft-Symbolic Framework for Perceptual Task Planning
  • arXiv cs.AI: CogGym: Towards Large-Scale Comparative Evaluation of Human and Machine Cognition
  • arXiv cs.AI: PlaceReasoner-Beta: Reasoning-Driven Macro Placement and Benchmarking
  • arXiv cs.AI: Efficient Benchmarking in Production: A Study of an Evolving LLM Agent
  • arXiv cs.AI: LogicTrack: Auditing Reasoning Trajectories of Large Language Models with Formal Logic Solvers
  • arXiv cs.AI: PolyBridgeBench: Benchmarking Multimodal LLMs for Physics-Grounded Bridge Design
  • arXiv cs.AI: The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models
  • arXiv cs.AI: Reducing Barriers to Academic Support: Evaluating a Course-Specific RAG System for Addressing Help-Seeking Disparities in Higher Education
  • arXiv cs.AI: Calibrating Teacher--Student Discrepancy for On-Policy Distillation
  • arXiv cs.AI: GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation
  • arXiv cs.AI: World Modeling in Transformers
  • arXiv cs.AI: ECG Mirage: Revealing and Mitigating the Underutilisation of ECGs in Vision-Language Models for Clinical Prediction
  • arXiv cs.AI: What Should We Ask Next? Retrieval-Aware Question Learning under Partial Evidence
  • arXiv cs.AI: AutoViewMem: Self-Configuring Orthogonal Views for Conversational Long-Term Memory
  • arXiv cs.AI: Learning Cardiac Features: ECG Biometrics Across Time and~Exercise
  • arXiv cs.AI: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
  • arXiv cs.AI: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

← На главную