Исследования и достижения — arambolsu-ai

Новости

Исследования и достижения

Научная сторона: препринты и результаты, где заявлен новый рекорд, метод или неожиданный вывод.

Свежий выпуск · 13 августа, 03:07 · за последние 24 ч · историй: 18 · источники: arXiv cs.AI, arXiv cs.LG

Искусственный интеллект переходит от анализа к управлению: от ферм до агентов

В последние часы научное сообщество представило ряд ключевых исследований, демонстрирующих переход крупных языковых моделей от пассивного анализа данных к активному, автономному управлению сложными системами — от сельского хозяйства до финансовых решений. В центре внимания — новые архитектуры, методы интерпретации и подходы к персонализации, которые позволяют ИИ не просто «понимать», но и «действовать» в реальном времени, учитывая не только данные, но и неопределённость, контекст и даже моральные предпочтения пользователей.

Агенты в фермерских теплицах: ИИ как «пилот» в биологической системе

Новое исследование, опубликованное на arXiv, демонстрирует применение крупных языковых моделей в качестве автономных «пилотов» для управления микроклиматом и фенотипированием растений. Система, работающая на основе 49-канальной сети фитосенсоров (мультиспектральные, электрохимические и диэлектрические данные), использует LLM для интерпретации биофизических показателей растений и автоматического управления аппаратными актюаторами — от регулирования температуры до создания контролируемых стрессовых условий. Это закрытый цикл (closed-loop) позволяет ИИ не только анализировать, но и реагировать на изменения в реальном времени, что особенно важно для вертикальных ферм и лабораторных установок. Модель была протестирована на трёх кейсах, включая одиночные растения и масштабные установки, где агенты оптимизировали параметры, балансируя между ростом и стрессом.

Интерпретируемость и надёжность: от трафика до финансовых решений

Для повышения прозрачности и надёжности автономных систем исследователи предложили несколько новых методов. SPOT (Sampling Policy Observation Tree) — модель-независимый подход для интерпретации политик в глубоком обучении с подкреплением, строящий дерево возможных последующих состояний на основе выборок действий. Это позволяет анализировать не только текущие действия, но и их потенциальные последствия. В другом исследовании, посвящённом финансовой аналитике, предложен метод CAR-PL (Covariate-Adjusted Residual Policy Learning), который обучает модели на основе наблюдаемых бизнес-изменений, а не случайных рекомендаций, что позволяет улучшить прогнозы по прибыли и скорости роста. В то же время, в области управления ИИ в агентных системах — FlowScout — предлагает генерировать рабочие потоки, основываясь на реальных исполнениях задач, а не на симуляциях.

Персонализация и справедливость: от CV до предпочтений пользователей

Работа над персонализацией в агентах и ИИ-системах продолжается. DocsChisel — новый подход к адаптивной оптимизации документации инструментов для LLM, который анализирует ошибки агентов и корректирует описание инструментов в зависимости от задачи и модели. UserToolBench — первый в своём роде бенчмарк, оценивающий способность моделей принимать персонализированные решения на основе истории взаимодействий, включая распознавание недостатка информации и координацию нескольких инструментов. Важно, что эффективность зависит от конкретного профиля пользователя, модели и задачи — нет универсального решения. Также исследователи выявили «процедурную несправедливость» в RLHF: при агрегации разнородных предпочтений большинства доминируют, а меньшинства подавляются. Новый подход PA-RLHF разделяет обучение по модам предпочтений, что улучшает общую точность альянса и сокращает разрыв между группами.

Энергоэффективность и физика: от точности к устойчивости

Вопросы устойчивости и энергоэффективности становятся всё более актуальными. CurveFP — новый формат представления чисел для языковых моделей, который позволяет сократить количество битов без потери качества, улучшая производительность GEMM-операций. В то же время, в области прогнозирования состояния техники — Prognostics and Health Management — Physics-Informed Machine Learning (PIML) показал, что интеграция физических законов в модели повышает точность прогнозов и интерпретируемость, особенно в задачах с ограниченными данными. Работа по снижению углеродного следа моделей также получила развитие: в одном из исследований сравнивались шесть моделей на CPU, и определены этапы жизненного цикла, наиболее вредные для окружающей среды.

Геометрия, структура и надёжность: от трансформеров до распределённых систем

В области архитектуры моделей исследователи предложили новые подходы к анализу и обучению. TGO-IV — геометрический наблюдатель трансформеров, использующий топологию для анализа эволюции представлений через слои. SFRL — Sheaf-based Federated Representation Learning — позволяет агентам в распределённых системах обучаться и обмениваться представлениями без необходимости глобального пространства, используя геометрическую регуляризацию. В то же время, ReCBM — модель с неопределённостью, которая управляет связями между концептами, чтобы избежать распространения ошибочных сигналов. В области обучения с учителем — ReCBM улучшает восстановление концептов и задач при отсутствии или искажении данных, а также поддерживает интервенции в процессе.

Коротко

  • ИИ начинает управлять биологическими системами: LLM-агенты в реальном времени оптимизируют микроклимат и фенотипирование растений.
  • Новые методы интерпретации: SPOT для RL, CAR-PL для финансовых решений, FlowScout для агентных потоков.
  • Персонализация требует адаптации: DocsChisel и UserToolBench показали, что документация и предпочтения должны быть настроены под конкретного пользователя.
  • Энергоэффективность и устойчивость: CurveFP сокращает биты без потерь, PIML улучшает прогнозы в технических системах.
  • Геометрия и структура: TGO-IV и SFRL позволяют глубже понимать и обучать трансформеры и распределённые системы.
  • Справедливость в RLHF: PA-RLHF уменьшает предвзятость, разделяя обучение по модам предпочтений.

Что где прочитали

  • arXiv cs.AI: Closed-Loop LLM Co-Pilots for Digital Agriculture
  • arXiv cs.AI: SPOTting the Future: Lookahead Explanations for Deep Reinforcement Learning
  • arXiv cs.LG: Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory
  • arXiv cs.AI: MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis
  • arXiv cs.LG: Uncertainty-Aware Ensemble Deep Randomized Neural Networks for Classification
  • arXiv cs.LG: CurveFP: Rational-Radix Logarithmic Datatypes with Closed Products for Language Models
  • arXiv cs.LG: Sheaf-Based Federated Representation Learning
  • arXiv cs.LG: DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents
  • arXiv cs.LG: FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows
  • arXiv cs.LG: UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs
  • arXiv cs.LG: Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons
  • arXiv cs.AI: Towards Sustainable Artificial Intelligence: A Comprehensive Review and Comparative Analysis of Deep Learning Models' Carbon Footprint
  • arXiv cs.AI: ReCBM: Uncertainty-Gated Relational Reasoning for Concept Bottleneck Models
  • arXiv cs.LG: Detecting Soft Skills in ML Engineering Roles CVs
  • arXiv cs.LG: Physics-Informed Machine Learning in Prognostics and Health Management: A Systematic Literature Review
  • arXiv cs.LG: Observational Policy Ranking for SMB Financial Guidance from Multi-Action Accounting Logs
  • arXiv cs.LG: ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models
  • arXiv cs.LG: Procedural Fairness Failures in RLHF from Preference Averaging

Прошлые выпуски

Всего выпусков: 2

Новые подходы к распределённому обучению и адаптации моделей 12 августа, 20:47 · историй: 18
За 24 ч · источники: arXiv cs.LG

Новые подходы к распределённому обучению и адаптации моделей

Новые алгоритмы позволяют эффективно обучать крупные нейросети в распределённой среде с разнородными клиентами. SeFoRA — это метод, сочетающий LoRA (Low-Rank Adaptation) с федеративным обучением, который решает проблему несовместимости размерностей матриц при агрегации обновлений. Каждый клиент передаёт линейный «скетч» своих локальных изменений, что позволяет агрегировать обновления в небольшом подпространстве модели, избегая билинейного несоответствия. Вариант SeFoRA-Ho, ориентированный на одинаковые ранги, позволяет напрямую агрегировать адаптеры. Алгоритм сходится к окрестности первого порядка стационарной точки со скоростью O(1/T), а эксперименты на RoBERTa-Large показали его превосходство над текущими методами на наборах GLUE.

Модели и методы для анализа и прогнозирования временных рядов

Новые подходы используют LLM для адаптивного объединения прогнозных моделей. REATS — это система, которая использует цепочку рассуждений LLM для генерации весов ансамбля, основываясь на текстовых описаниях временных рядов и числовых признаках. Это позволяет создавать интерпретируемые и адаптивные веса, учитывающие особенности конкретных данных. Для эффективного использования LLM в ансамблях предложены структурированные входные данные с фиксированным токен-расходом и методы обучения с учетом приоритетов похожих случаев. Также представлены методы для улучшения прогнозирования с помощью гибридных архитектур, таких как CRHT, который сочетает 1D-конвейерные слои с вниманием, и использует онлайн-выбор кластеров для борьбы с географической несбалансированностью данных.

Улучшение безопасности и эффективности в RL и агентных системах

Разработаны новые методы для безопасного и эффективного обучения агентов. BSPG — это метод градиентного подъёма, который активно ищет оптимальные решения на границе ограничений, что позволяет улучшить сходимость и гарантировать выполнение условий KKT. Также предложен MERA — метод эволюции и маршрутизации моделей с адаптацией навыков, который улучшает малую модель, используя демонстрации из неудачных вызовов, и обучает адаптер LoRA. Модель получает доступ к навыкам через SkillBook, который обновляется по мере обучения, и используется в маршрутизаторе с проверкой качества. В RL для задач с инструментами предложен SINKFLEX-RL — модульная система, оптимизирующая внимание и снижающая VRAM на 19,7% при сохранении производительности.

Моделирование физических систем и динамики

Новые подходы позволяют более точно моделировать физические системы. HNN (Hamiltonian Neural Networks) показали улучшение на 42-кратное снижение дрейфа энергии и на 15,8-кратное снижение ошибки траектории на нелинейном маятнике по сравнению с базовыми сетями. Это достигается за счёт введения архитектурного приоритета, основанного на сохранении гамильтониана. Также представлены методы для анализа и прогнозирования траекторий судов на основе AIS-данных. STCAD — это масштабируемая система кластеризации и обнаружения аномалий, использующая BERT-подобную модель и иерархическую кластеризацию. CRHT — гибридный трансформер, сочетающий локальные и глобальные особенности, показал лучшие результаты в краткосрочном прогнозировании.

Оценка и калибровка моделей

Разработаны методы для улучшения калибровки и оценки моделей. InvLT — это метод инвертируемой трансформации логитов, который сохраняет порядок классов и не зависит от размера пространства классов. Он применяет обучаемую скалярную MLP к логитам, что позволяет сохранить предсказания и улучшить калибровку. Fisher8 — метод, использующий геометрию Фишера для коррекции градиентов в задачах регрессии с оценками неопределённости. Он улучшает сходимость и калибровку, не требуя дополнительных гиперпараметров. Также представлены методы для оценки LLM в контексте прав человека — HumRightsBench, который использует адаптированный IRAP-фреймворк для оценки правовых рассуждений.

Модели и методы для генеративных задач и структурированного обучения

Новые подходы позволяют улучшить генеративные модели и структурированное обучение. ELMER — это эволюционная модель языка, которая генерирует и улучшает программные описания, используя Qwen3-8B и метод oDPO. Она обучается на трёх операциях: семантических изменениях, компиляции в специализированный язык и переводу обратно. Модель показала улучшение как в калибровке поведения, так и в эффективности поиска. Также представлен Power Law Graph Attention — альтернатива SDPA, которая заменяет фиксированную билинейную форму на обучаемую, но имеет проблему коллапса на этапе инференса. Для улучшения стабильности предложены методы, основанные на геометрии Фишера и калибровке логитов.

Коротко

  • SeFoRA — новый алгоритм федеративного обучения LoRA, позволяющий агрегировать обновления с разнородными рангами, с улучшенной сходимостью и производительностью.
  • REATS — метод, использующий LLM для адаптивного ансамблирования временных рядов, с интерпретируемыми весами и гибридными входными данными.
  • BSPG — метод градиентного подъёма, который ищет оптимальные решения на границе ограничений, обеспечивая сходимость и выполнение условий KKT.
  • HNN — архитектура, моделирующая консервативные динамики, показала улучшение на 42-кратное снижение дрейфа энергии на маятнике.
  • InvLT — метод калибровки, сохраняющий предсказания и не зависящий от размера пространства классов, с улучшенной калибровкой.
  • Fisher8 — метод коррекции градиентов с использованием геометрии Фишера, улучшающий сходимость и калибровку в задачах регрессии.
  • ELMER — эволюционная модель, генерирующая и улучшающая программные описания, с использованием Qwen3-8B и oDPO.
  • Power Law Graph Attention — альтернатива SDPA, с проблемой коллапса на этапе инференса, требующая дополнительной стабилизации.

Что где прочитали

  • arXiv cs.LG: SeFoRA: Sketch-Aggregated Federated Low-Rank Adaptation with Heterogeneous Client Ranks
  • arXiv cs.LG: The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom
  • arXiv cs.LG: REATS: LLM Reasoning-based Ensemble Learning for Adaptive Time Series Forecasting
  • arXiv cs.LG: Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability
  • arXiv cs.LG: From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation
  • arXiv cs.LG: ELMER: Evolutionary Language Model that Explores and Refines
  • arXiv cs.LG: Boundary-Seeking Policy Gradient for Safe Reinforcement Learning
  • arXiv cs.LG: A matched-integrator evaluation of Hamiltonian neural networks on pendulum and Kepler dynamics
  • arXiv cs.LG: STCAD: Scalable Trajectory Clustering and Anomaly Detection on Terabyte-Scale AIS Data
  • arXiv cs.LG: CRHT: A Continuous Regression Hybrid Transformer for Vessel Trajectory Prediction with Online Cluster Sampling
  • arXiv cs.LG: Toward Human Rights Benchmarking for LLMs: A Pilot Methodology
  • arXiv cs.LG: Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference
  • arXiv cs.LG: MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale
  • arXiv cs.LG: Accelerated Learning of High Dimensional Functions with a Tensor-Featured Training Network
  • arXiv cs.LG: Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
  • arXiv cs.LG: Invertible Logits Transformation for Accuracy-Preserving Post-Hoc Uncertainty Calibration
  • arXiv cs.LG: Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry
  • arXiv cs.LG: Generator-Guided Inverse Sampling for L\'evy-Driven Generative Models
Искусственный интеллект переходит от анализа к управлению: новые подходы в агрономии, интерпретации и персонализации 12 августа, 14:17 · историй: 18
За 24 ч · источники: arXiv cs.AI, arXiv cs.LG

Искусственный интеллект переходит от анализа к управлению: новые подходы в агрономии, интерпретации и персонализации

В последние часы научное сообщество представило ряд ключевых исследований, расширяющих границы применения крупных языковых моделей (LLM) и методов машинного обучения. В центре внимания — переход от пассивного анализа данных к активному управлению процессами, в том числе в биологических и агрономических системах, а также новые методы интерпретации, персонализации и устойчивого обучения. Важно, что большинство исследований сосредоточено на решении практических задач: от оптимизации микроклиматов в вертикальных фермах до улучшения понимания поведения агентов в RLHF и адаптации моделей к несовершенным входным данным.

Агрономия на основе закрытого цикла: LLM как биологический инженер

Новая работа, опубликованная на arXiv, демонстрирует применение LLM в агрономии как автономных систем управления. Исследователи создали закрытый цикл, в котором модель анализирует данные с 49-канальной сети фитосенсоров (мультиспектральные, электрохимические, диэлектрические измерения), интерпретирует их на естественном языке и, главное, управляет аппаратными актуаторами для оптимизации микроклимата, проведения фенотипирования или создания контролируемых стрессовых условий. Система прошла тестирование на трех кейсах — в вертикальной ферме и в установке с одним растением — и способна распознавать сложные флуктуации в растительной физиологии. Это первый шаг к полноценному AI-биологическому интерфейсу, где модель не только анализирует, но и управляет.

Интерпретация и управление: от RL до геометрии трансформеров

В области интерпретации агентов в RL и трансформеров появилось несколько важных подходов. SPOT (Sampling Policy Observation Tree) — новый метод, позволяющий строить деревья возможных последующих состояний, чтобы визуализировать предпочтения агента и его потенциальные сценарии. Он применим к DRL-агентам, например, в задачах управления светофорами, и позволяет сравнивать альтернативные траектории. В то же время TGO-IV — геометрический анализ трансформеров на основе persistent homology — позволяет отслеживать эволюцию представлений через слои, выявляя, когда и как входные данные превращаются в задачно-значимые признаки. Эти методы помогают не просто «понять», что делает модель, но и «предсказать», как она будет действовать в будущем.

Модели для несовершенных данных: от недостающих модальностей до устойчивого обучения

Работы, посвященные работе с несовершенными данными, предлагают новые стратегии. MIDAS (Mutual Information Disentanglement with uncertainty-Aware fuSion) — унифицированный подход для анализа мультимодальных эмоций, когда модальности частично отсутствуют. Он использует вариационную модель и разделяет представления на общие и исключительные факторы, чтобы эффективно использовать оставшиеся данные. В то же время IF-dRVFL и IF-edRVFL — устойчивые версии глубоких случайных нейросетей — используют интуиционистскую нечеткую логику для выделения весов на основе близости к центрам классов и гетерогенности в окрестностях, что повышает устойчивость к шуму и выбросам.

Устойчивость, персонализация и справедливость: от углеродного следа до RLHF

Вопросы устойчивости и справедливости также получили развитие. Исследование по углеродному следу AI сравнивает шесть моделей на CPU, выявляя, какие этапы жизненного цикла (обучение, инференс) вносят наибольший вклад в выбросы. В то же время ReCBM — модель с неопределенностью, которая управляет связями между концептами в концепт-бутлентах — позволяет учитывать неуверенность при обработке данных, что улучшает восстановление и интервенцию. В RLHF обнаружена проблема «процедурной несправедливости» — когда предпочтения большинства доминируют над меньшинством. PA-RLHF — метод, разделяющий оптимизацию по группам предпочтений — улучшает общую точность альгинмента с 46,9% до 67,9% и сокращает разрыв между группами.

Инструменты, агенты и пользователи: от документации до финансовой рекомендации

Разработка инструментов для LLM-агентов получила развитие: DocsChisel — адаптивная система оптимизации документации инструментов, которая анализирует ошибки агентов и корректирует документацию в зависимости от задачи и модели. FlowScout — автоматизированная генерация агентных рабочих процессов на основе исторических данных, с учетом реальных вызовов инструментов. В то же время UserToolBench — новый бенчмарк для персонализированного принятия решений — оценивает, как модели могут инферировать скрытые предпочтения пользователей, учитывая нехватку информации и координацию нескольких инструментов. В финансовой сфере CAR-PL — метод ранжирования политик на основе наблюдаемых данных — показал лучшие результаты в прогнозировании прибыли и краткосрочных финансовых показателей.

Коротко

  • LLM теперь могут управлять биологическими системами в реальном времени, оптимизируя микроклимат и проводя эксперименты.
  • Новые методы интерпретации (SPOT, TGO-IV) позволяют понимать не только текущие действия, но и будущие сценарии агентов.
  • MIDAS и IF-dRVFL решают задачи работы с несовершенными данными и шумом, повышая устойчивость моделей.
  • Устойчивость и справедливость — ключевые темы: от углеродного следа до процедурной справедливости в RLHF.
  • Развиваются инструменты для LLM-агентов: от адаптивной документации до персонализированных финансовых рекомендаций.

Что где прочитали

  • arXiv cs.AI: Closed-Loop LLM Co-Pilots for Digital Agriculture
  • arXiv cs.AI: SPOTting the Future: Lookahead Explanations for Deep Reinforcement Learning
  • arXiv cs.LG: Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory
  • arXiv cs.AI: MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis
  • arXiv cs.LG: Uncertainty-Aware Ensemble Deep Randomized Neural Networks for Classification
  • arXiv cs.LG: CurveFP: Rational-Radix Logarithmic Datatypes with Closed Products for Language Models
  • arXiv cs.LG: Sheaf-Based Federated Representation Learning
  • arXiv cs.LG: DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents
  • arXiv cs.LG: FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows
  • arXiv cs.LG: UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs
  • arXiv cs.LG: Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons
  • arXiv cs.AI: Towards Sustainable Artificial Intelligence: A Comprehensive Review and Comparative Analysis of Deep Learning Models' Carbon Footprint
  • arXiv cs.AI: ReCBM: Uncertainty-Gated Relational Reasoning for Concept Bottleneck Models
  • arXiv cs.LG: Detecting Soft Skills in ML Engineering Roles CVs
  • arXiv cs.LG: Physics-Informed Machine Learning in Prognostics and Health Management: A Systematic Literature Review
  • arXiv cs.LG: Observational Policy Ranking for SMB Financial Guidance from Multi-Action Accounting Logs
  • arXiv cs.LG: ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models
  • arXiv cs.LG: Procedural Fairness Failures in RLHF from Preference Averaging

← На главную