Новые подходы к коррекции и оценке генерации моделей
Новые алгоритмы позволяют моделям корректировать собственные генерации в процессе вывода — не просто улучшая последовательность, а возвращаясь к предыдущим шагам и пересматривая их. В работе Spectral Feedback для дискретных диффузионных моделей предложено метод, который позволяет модели в цикле обратной связи выбирать позиции для редактирования токенов, пересыпая их заново. Это подобно редактированию изображений, где шумовые латенты reintroduce и перезапускаются. В отличие от методов, максимизирующих награду за выбор токенов, здесь ключевой задачей становится выбор именно тех позиций, которые стоит пересмотреть — с учётом взаимозависимости изменений: редактирование одного токена влияет на другие. Авторы предлагают формализовать это как «множество редактирований» — набор позиций, которые пересыпаются и перегенерируются. Метод требует сложного балансирования, поскольку эффекты редактирования переплетаются.
Улучшение распознавания речи в шумных полицейских коммуникациях
Для улучшения работы аудиомоделей на шумных полицейских записях (BPC) исследователи изучили эффективность псевдо-меток (pseudo-labeling) — метода, который позволяет обучать аудиомодели без ручной аннотации. В работе показано, что внутренние метрики уверенности (лог-вероятности, STAR-оценки) не способны различать качество псевдо-транскриптов в шумных условиях. Вместо этого авторы предложили использовать внешний LLM-судья — модель, которая фильтрует транскрипты на основе контекстной логики, отбрасывая неправдоподобные варианты. Этот фильтр работает более агрессивно, чем внутренние метрики, и снижает ошибку WER на корпорах из Балтимора и Чикаго. Однако остаётся значительный разрыв по сравнению с идеальным фильтром. Также предложен новый кросс-модельный подход, где одна модель тонко настраивается на основе псевдо-меток другой модели.
Оценка понимания контекста в LLM через графы знаний
Новые методы оценки LLM фокусируются на понимании контекста, а не на поверхностной генерации. В работе предложена новая система оценки на основе графов знаний (knowledge graphs), которая измеряет, насколько модель правильно извлекает, интегрирует и рассуждает над информацией в контексте. Традиционные метрики, такие как BLEU или perplexity, не отражают глубину понимания, особенно в задачах, где ответ должен быть фактологически и контекстно корректен. В новой системе используется S3KG — гибридная мера схожести, объединяющая структурные и семантические сигналы. Также разработан диагностический анализ, позволяющий выявлять и классифицировать типы ошибок модели. Это даёт возможность не просто оценивать, а понимать, где модель «заблуждается» в контексте.
БиоEVAL: глобальный бенчмарк для LLM в биоинженерии
Впервые создан глобальный, мультиинституциональный бенчмарк BioEVAL для оценки LLM и мультимодальных моделей в биоинженерии. Он охватывает 11 ключевых поддисциплин и включает 608 задач: 380 вопросов с выбором ответа, 218 задач на синтез литературы и 10 задач с интерпретацией экспериментальных изображений. Бенчмарк разработан 22 научными группами, прошёл аудит и экспертную проверку. В результате 21 вопрос был отмечен для редактирования или удаления, и все отчётные результаты по MCQ построены на оставшихся 359 вопросах. BioEVAL позволяет оценивать не только фактическое знание, но и экспериментальное мышление — что ранее было недостаточно в существующих бенчмарках.
Benchy: универсальный язык для бенчмарков задач-ориентированных AI
Benchy — это новый семантический язык и движок для бенчмарков, который позволяет описывать задачи, оценки и данные в стандартизированном формате. Каждый бенчмарк описывается как набор: программа (P), функция оценки (S) и набор данных (D). Внешние системы AI интегрируются через универсальный контракт — входной объект с полями, которые определяют, что нужно передать, и выходной объект, который определяет, что ожидать. Семантические концепты описаны в единой онтологии, а программа компилируется в каноничный JSON, который исполняется движком. Компиляция не меняет смысл — она не исправляет ошибки или добавляет скрытые значения. Это позволяет создавать надёжные, воспроизводимые бенчмарки, независимо от того, какую модель используют.
Улучшение эволюционной оптимизации с помощью учителей и гауссовых процессов
В задачах, где оценка кандидатов слишком дорога (например, в TinyML), исследователи предложили метод Teacher-Guided Learning NSGA-II (TGL-NSGA-II). Он использует предобученную модель-учитель, которая разделяет кандидатов на слои по сложности и классу. Каждый кандидат проходит короткую процедуру knowledge-distillation (KD-Lite) на компактном наборе данных, а затем оценивается на отдельном наборе. Эта оценка затем фьюзится с гауссовым процессом, чтобы выбрать кандидатов для полной оценки. Метод позволяет снизить вариацию оценок, повысить концентрацию и уменьшить инверсию рангов. На задачах по распознаванию ключевых слов и классификации птичьих звуков Kendall-τ составил 0.74 и 0.62 — что выше, чем у базовых методов.
Повышение достоверности агентов через интуитивные промпты
В исследовании, посвящённом поведению LLM-агентов в симуляции реакций на социальные медиа, показано, что интуитивные промпты («отвечай сразу, без анализа») дают лучшую достоверность, чем аналитические. Участники из Сербии были проанализированы через анкеты, интервью и самопрезентации, а их реакции на 68 постов предсказывались четырьмя моделями. Оказалось, что агенты, которые соответствовали профилю, были более последовательны, чем сами участники. Также выявлено, что агенты, получившие интуитивные инструкции, лучше сохраняли индивидуальные различия — в то время как аналитические промпты сжимали разнообразие в семь раз по сравнению с человеческими реакциями.
Atelier: извлечение локальных признаков для крио-ЭМ-картин
Для анализа крио-ЭМ-картин (CryoEM) предложена новая архитектура Atelier, основанная на гиперсетях и implicit neural representations (INR). В отличие от традиционных методов, которые работают с фиксированными воксельными сетками, Atelier обучается на 5439 картах из Electron Microscopy Data Bank и может генерировать высококачественные реконструкции для разных белковых ассоциаций. Ключевое преимущество — возможность извлекать локальные, непрерывные признаки в любой точке пространства через промежуточные активации INR. Это дает возможность анализировать структуры на разных масштабах, что невозможно с воксельными или патч-токенными архитектурами.
HARDEN: создание сложных, но корректных тестовых случаев
HARDEN — метод эволюционного поиска, который адаптирует существующие тестовые случаи в более сложные, но сохраняющие ответы. Он ищет варианты, усложняющие задачу, но не меняющие семантику или реалистичность. Проверка проводилась на трёх задачах: FinQA, PubMedQA и ContractNLI, с моделями Qwen3.5 разных размеров. В среднем HARDEN снижает точность на 22.7%, а в некоторых случаях — до 49.9% по сравнению с базовыми методами. Это показывает, что эволюционный поиск может создавать более сложные и реалистичные тестовые случаи, которые лучше отражают реальные условия эксплуатации моделей.
T-RoPE: временное позиционное вложение для рекомендаций
В рекомендательных системах, основанных на архитектуре Transformer, используется RoPE — метод позиционного вложения, который кодирует относительные позиции токенов. Однако в рекомендациях важно не только порядок событий, но и время между ними, сезонность и цикличность. В T-RoPE предложено заменить индекс-базированное вложение на временное — с использованием временных меток, обучаемых коэффициентов, многоуровневых частотных банков и нестационарного вращения ключей. Это позволяет модели различать сезонные контексты, что невозможно в стандартном RoPE. На пяти бенчмарках T-RoPE показал лучшие результаты по всем метрикам, улучшив HR@10 на 78–130% на данных PixelRec.
Оценка надёжности транскрипции в аудиомоделях
В аудиомоделях часто возникает проблема: модель не может оценить надёжность собственной транскрипции. В исследовании показано, что модели плохо оценивают свою надёжность — они чаще всего предсказывают, что транскрипция надёжна, даже когда она ошибочна. Существующие методы (оценка качества звука, неопределённость генерации, WER) дают слабые сигналы. Авторы обнаружили, что надёжность транскрипции хорошо отражается в представлениях аудио-энкодера. На этой основе они разработали лёгкий предиктор надёжности, работающий на фиксированных представлениях, и который оценивает надёжность до генерации — что позволяет избежать ошибочных ответов.
LLM Parkinsonism: проблема «непрекращающегося действия» в агентах
В агентах на основе LLM часто наблюдается «паркинсонизм» — когда модель продолжает выполнять действия, даже после того, как цель достигнута, создавая ненужные уточнения, проверки и переработки. Это не объясняется только автокодированием токенов, а связано с концентрацией всех функций управления (планирование, оценка прогресса, остановка) в одном цикле. Авторы предложили архитектуру Global Executive Control (GEC), которая разделяет генерацию действий и контроль над проектом. В экспериментах GEC показал 96.57% успеха в достижении целей, что выше, чем у базовой модели (67.42%) и кандидат-сети (96.53%).
Тестирование мышления в LLM для трейдинга
В исследовании оценивается, приносит ли дополнительное «мышление» (reasoning) в LLM при трейдинге реальные экономические выгоды. Авторы провели контролируемый эксперимент с моделями DeepSeek, GPT и Gemini на годовых данных американских акций. Они измеряли влияние уровня мышления на портфельные результаты, сохраняя постоянными информацию, промпты и форматы. Результаты показали: дополнительное мышление не приводит к устойчивому улучшению доходности. Для DeepSeek, где исследовали весь спектр мышления, результаты были не монотонными. Повторные генерации также приводили к нестабильным эффектам — даже при схожих оценках, портфели сильно различались.
LAVOIR: обучение агентов, когда и что спрашивать
LAVOIR — это архитектура, которая обучает агентов (вроде Laya) не только отвечать, но и определять, когда и что спрашивать. Вместо того чтобы просто гадать, когда информация недоступна, агент получает ввод с возможными «слотами» — кандидатами на недостающую информацию. В одном проходе он возвращает распределение ответов и ожидаемую выгоду (Value of Information) для каждого слота. Эта оценка не требует меток — она строится на основе схем, LLM, который только генерирует текст, и проверяющих моделей. В экспериментах LAVOIR достигает результатов, близких к теоретическому пределу Байеса.
CRC-Router: рискованная маршрутизация в медицинских агентах
Для безопасного внедрения агентов в медицинскую диагностику предложена архитектура CRC-Router — модуль маршрутизации, который определяет, когда агент может действовать автономно, а когда нужно передать случай врачу. Он объединяет несколько сигнатур неопределённости с прогнозным счётом и применяет Conformal Risk Control (CRC) для калибровки порогов при заданном уровне риска. На данных NIH ChestX-ray14 CRC-Router показал лучшие результаты по всем метрикам, особенно в задачах с многократными находками — где важно не только точность, но и надёжность принятия решений.
Анализ и сокращение затрат в кодовых агентах
В исследовании проанализированы 1200 траекторий кодовых агентов (Claude Code, Mini-SWE-Agent) на SWE-bench Verified. Выявлены три основные неэффективные поведения: избыточное извлечение, генерация похожих скриптов и повторное выполнение тестов. Три стратегии сокращения затрат были протестированы: структурированное извлечение, синтез навыков агентом и дизайн навыков разработчиком. Структурированное извлечение может увеличить затраты на 28%, а синтез навыков даёт только низкоуровневые инструкции. В то же время, навыки, разработанные человеком, показали высокую эффективность и универсальность — они сокращают затраты и повышают качество.
Learning What to Skip: экономия токенов в мультиагентных потоках
В мультиагентных потоках (планирование, выполнение, проверка, резюме) часто выполняются неэффективные шаги. В работе Learning What to Skip (LW2S) предложен метод, который учит, когда можно пропустить шаг, используя контрфактную кредитную атрибуцию: сравнивая результаты полного потока с результатами, где шаг пропущен. Модель учится на основе этих интервенций и использует калибровку и внутренние «ограничители»
Что где прочитали
- arXiv cs.AI: Spectral Feedback for Test-Time Alignment of Protein Diffusion Models
- arXiv cs.AI: Pretrained ASR Pseudo-labeling for Noisy Police Audio
- arXiv cs.AI: Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework
- arXiv cs.AI: BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering
- arXiv cs.AI: Benchy: towards a universal language for task-oriented AI benchmarks
- arXiv cs.AI: Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study
- arXiv cs.AI: Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content
- arXiv cs.AI: Atelier: Learning Local Self-Supervised Features for CryoEM Volumes via Hypernetworks
- arXiv cs.AI: HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases
- arXiv cs.AI: T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation
- arXiv cs.AI: Audio LLMs Know When They Can't Hear You
- arXiv cs.AI: LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents
- arXiv cs.AI: The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?
- arXiv cs.AI: LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information
- arXiv cs.AI: CRC-Router: Risk-Constrained Routing for Medical Agentic AI Systems
- arXiv cs.AI: Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents
- arXiv cs.AI: Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows
- arXiv cs.AI: From S3Q Theory to Implementation: Towards an Architecture for Machine Qualia