Frontier AI Research

每天从 arXiv cs.AI 自动收录的论文,标题与摘要中英对照。 这里不做人工挑选——收到什么就是什么,所以不会停留在某一年。

289 篇 · 最新收录 2026-09-10

arXiv:2609.09056 2026-09-10 cs.AIcs.MAeess.SYmath.CT

时变数据作为滑轮: 引发叙述

Time-Varying Data as Sheaves: an Invitation to Narratives

Wilmer Leal, Benjamin Merlin Bumpus, Jana K. Nickel, Johan García, James Fairbanks, Warren Dixon

现代科学和工程越来越依赖于时变数据,,但用于模拟时间现象的数学工具经常被开发出来......

arXiv:2609.09081 2026-09-10 cs.AI

一切都在适度: 每个域覆盖范围最优和多域训练中的抗对齐域差距

Everything in Moderation: Per-Domain Coverage Optima and Alignment-Resistant Domain Gaps in Multi-Domain Mid-Training

Yunpeng Xu, Kun Zheng

训练中期, 预训练和对齐, 之间的阶段是模型的 每个域数据组合通常由数据可用性设置的阶段,而不是...

arXiv:2609.09094 2026-09-10 cs.AI

自我对弈中近似值迭代的惊人效果

The Surprising Effectiveness of Approximate Value Iteration in Self-Play

Raphael Boige, Amine Boumaza, Bruno Scherrer

将搜索与函数逼近相结合推动了游戏程序的重大进步, 使自玩算法比以往更具竞争力......

arXiv:2609.09113 2026-09-09 cs.AIcs.CLcs.LG

SAEScientist-Bench: AI 代理能否进行自主 SAE 可解释性研究?

SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu

虽然递归自我改进(RSI)的研究主要采用自动化模型训练管道,,但可靠的自主开发需要错误的...

arXiv:2609.09115 2026-09-09 cs.AIcs.SE

MeClear: 长期 LLM 代理的合作博弈论归因和风险意识内存清除

MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents

Boyu Yang, Jiazheng Sun, Zilong Lu, Zhi Qiu, Xin Peng, Jun Zheng

长期大型语言模型 (LLM) 代理依靠外部存储系统来跨扩展交互保留用户偏好和任务知识...

arXiv:2609.09126 2026-09-09 cs.AIcs.LGstat.ML

Amari的 贝叶斯对偶性的推广

A Generalization of Amari's Bayesian Duality

Mohammad Emtiyaz Khan, Thomas Möllenhoff

Amari 对信息几何和机器学习的贡献是众所周知的。在这里,我们重新审视Amari的关于贝叶斯对偶性的工作,该工作尚未记录...

arXiv:2609.09133 2026-09-09 cs.AIcs.CLcs.SE

ExecCritic: 学习测试, 测试以改进编码代理

ExecCritic: Learn to Test, Test to Improve for Coding Agents

Leitian Tao, Baolin Peng, Haorui Wang, Hang Wang, Hao Cheng, Wenlin Yao, Qianhui Wu, Tao Ge, Sharon Li, Jianfeng Gao

执行反馈可以指导编码代理进行正确的存储库修复,,但前提是测试捕获了问题所请求的行为。年龄...

arXiv:2609.09134 2026-09-09 cs.AI

共同进化的工具和模型: 策略修正帮助较弱的模型赶上模仿失败的地方

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur

代理利用(系统提示,工具集,执行挂钩,和围绕模型的上下文管理支架)是代理的关键决定因素...

arXiv:2609.09137 2026-09-09 cs.AIcs.CL

用于识别医疗流程中 RPA 机会并确定优先级的数据驱动框架

A Data-Driven Framework for Identifying and Prioritizing RPA Opportunities in Healthcare Processes

Maria Alejandra Gomez, Juan Manuel Castillo

机器人流程自动化 (RPA) 被广泛用于减轻美国医院的行政负担,,但估计有 30-50% 的 RPA 计划...

arXiv:2609.09153 2026-09-09 cs.AIcs.CLcs.MA

程序图: LLM 代理的自演化执行结构

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık

大型语言模型越来越多地被部署为能够进行长期规划并通过外部工具执行操作的代理。大多数代理选择行动通过...

arXiv:2609.05275 2026-09-09 cs.AI

Don't Dropout: 优化层稀疏性以实现高效的 LLM 训练和推理

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

Mostafa Elhoushi, Alex Pretko, Nolan Dey, Bin Claire Zhang, Gavia Gray, Gurpreet Gosal, Abdulrahman Mahmoud, Shane Bergsma, Joel Hestness

Layer dropout (a.k.a.随机深度) 已被证明可以实现更快的训练, 更高的准确性, 以及对零样本层剪枝的鲁棒性...

arXiv:2609.05279 2026-09-09 cs.AIcs.MA

测试 LLM 代理团队的可互换性

Testing Interchangeability in LLM Agent Teams

Jianxin Gao, Tianyi Yu, Linna Deng, Runze Li, Zining Wang

Production multi-agent systems replace agents constantly, on the assumption that an agent filling a role is interchangeable with any other agent that ...

arXiv:2609.05284 2026-09-08 cs.AI

GUT: 通过图复杂性量化和优化LLM的推理不确定性

GUT: Quantifying and Optimizing the Reasoning Uncertainty of LLMs via Graph Complexity

Shuang Liang, Xin-Yu Hu, Xiang-Jun Ou, Shao-Qun Zhang

近年来,大型语言模型(LLMs) 的推理能力取得了巨大进步。然而, LLM的推理过程通常...

arXiv:2609.05289 2026-09-08 cs.AI

超越总分: 评估基于参考的自动评估方法的行为正确性假设

Beyond Aggregate Scores: Behavioral Correctness Assumptions for Assessing Reference-Based Automatic Evaluation Methods

Maria Mahbub, Ashley Rice, Michael R. Munroe, Amidu Kamara, Amir Sadovnik

基于参考的自动评估方法在评估自然语言生成系统中发挥着至关重要的作用。现有的元评估主要...

arXiv:2609.05295 2026-09-08 cs.AI

RISE: 通过自外推策略蒸馏进行递归改进

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

Yang Li, Semih Yavuz, Shafiq Joty

在策略蒸馏(OPD) 为语言模型训练后, 提供密集的, 每个标记监督,但其有效性受到教师的瓶颈......

arXiv:2609.05314 2026-09-08 cs.AIcs.CLeess.SY

建筑能源系统中 HVAC 操作的大型语言模型: 对方法的严格审查, 应用程序, 和部署准备情况

Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness

Alexander Neubauer, Tianzhen Hong, Han Li, Mengbo Yu, Amin Darbandi, Yannick Fürst, Martin Kriegel

楼宇自动化系统生成丰富的传感器数据,但仍然缺乏洞察力,因为异构点命名, 缺少元数据, 和碎片化文档...

arXiv:2609.05327 2026-09-08 cs.AIcs.AR

基于二元决策图的LLM驱动的量子电路综合算法设计

LLM-Driven Algorithm Design for Quantum Circuit Synthesis based on Binary Decision Diagrams

Yoonju Sim, Federico Berto, Chuanbo Hua, Jinkyoo Park, Changhyun Kwon

量子电路是在量子器件, 上实现量子算法的核心,其中量子门必须是可逆的。许多量子算法...

arXiv:2609.05333 2026-09-08 cs.AIcs.CL

Transformer 语言模型中上下文个性化测量工具包技术手册

Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models

José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez, Marcelo Vinicius de Paula, Tárcio André dos Santos Barros

Transformer 语言模型将单个 , 上下文无关向量分配给其嵌入层 , 的单词类型,但人们普遍认为它可以个性化......

arXiv:2609.05339 2026-09-08 cs.AIcs.CLcs.IR

您的代理的 内存能否在模型升级后继续存在? 内存可移植性的受控研究

Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

Ankit Goyal, Jaideep Ray

模型升级是例行公事,而 3B 内存迁移则不然。代理可以保留相同的内存存储,但仍然会忘记:新模型可能会解释旧的注释......

arXiv:2609.05346 2026-09-08 cs.AI

谁应该给我的作业评分? 学生对高等教育中透明人工智能辅助写作评估的看法

Who Should Grade My Work? Student Perspectives on Transparent AI-Assisted Writing Assessment in Higher Education

Rayed AlGhamdi

GenAI 工具集成到高等教育评估中引发了关于学生如何理解,、解释, 并对 AI 做出反应的重要问题......

arXiv:2609.05374 2026-09-08 cs.AI

CUA-Universe: 混合 GUI+CLI 代理的可扩展动态环境

CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents

Haoting Shi, Wenhao Wang, Weicheng Fang, Yaozhong Liang, Tian Jin, Pengxiang Zhao, Guangyi Liu, Siheng Chen, Yanfeng Wang

计算机使用代理在 OSWorld 和 AndroidWorld, 等基准上取得了进步,但仍然主要通过 GUI, 进行操作,通常会产生低效的轨迹...

arXiv:2609.05381 2026-09-08 cs.AI

前沿语言模型中已发布值的分子 Déjà Vu: 数字级检索

Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Roland C. Aydin, Christian Feiler

大型语言模型 (LLMs) 越来越多地在分子属性基准, 上进行评估,但准确性无法区分预测属性的模型...

arXiv:2609.05385 2026-09-08 cs.AI

必要或充分? 用行为证据评估 LLM 解释

Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence

Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri

可以在代理工作流程中运行的法学硕士决策组件通常会产生与行动相关的建议或判断以及解释......

arXiv:2609.05395 2026-09-08 cs.AIcs.CL

通过韩国开放公共 API 进行多步骤工具调用: 基准和数据合成方法

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

Dain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh, Kyuseong Lim

数据主权法规越来越要求公共机构部署开源, 本地 LLM 代理,将多个工具调用链接到...

arXiv:2609.05396 2026-09-08 cs.AI

用于合成标记无线信号的深度生成模型

A Deep Generative Model for Synthesizing Labeled Wireless Signals

Yuxiao Li, Keke Hu, Santiago Mazuelas, Yuan Shen

具有位置相关标签的无线信号对于无线传感领域的性能评估和模型训练至关重要。然而...

arXiv:2608.13547 2026-08-15 cs.AIcs.SE

QuoteBench: 匹配分数如何隐藏命令路径故障

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

LLM 编码代理通过接口发出 Bash 命令,这些命令可以序列化, 包装, 并重新解析模型输出。仅匹配的执行分数并不能区分...

arXiv:2608.13558 2026-08-15 cs.AIcs.CL

OmniScientist: 全模式全学科人工智能科学家

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

基础模型的最新进展使 AI 科学家能够自动化日益完整的研究工作流程,,从假设生成到分析……

arXiv:2608.12150 2026-08-14 cs.AIcs.CL

谁的想法最好取决于你让他们多长时间: 法学硕士评估中的预算相关排名

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

Rodrigo Guedes de Souza, Alison R. Panisson

大型语言模型的标准评估假设在推理条件下模型排名稳定。我们通过改变...来挑战这个假设。

arXiv:2608.12192 2026-08-14 cs.AIcs.LG

如何使用您的 Oracle 预算%3蛋白质结构预测模型实用指南

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth

蛋白质结构预测的基础模型在某些目标上仍然不可靠。外部预言机可以标记并纠正这些故障,,但生物......

arXiv:2608.12249 2026-08-14 cs.AI

传统 HPC 现代化的代理工作流程: 转换 GAMESS 的两电子整体核心

An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

对遗留 Fortran 进行现代化改造是一个很大的问题:,转换是单独的例行程序,,但代码库可能非常庞大,,并且跨越了大部分...

arXiv:2608.12282 2026-08-14 cs.AI

VAKRA: 评估跨 API 的多跳推理和工具使用策略下的检索

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

部署在企业环境中的代理必须跨结构化 API 和文档集合进行推理,,但现有基准评估这些功能...

arXiv:2608.12304 2026-08-14 cs.AI

使用检索增强大型语言模型将动态主逻辑模型构建为复杂系统诊断的知识图

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

动态主逻辑(DML)通过将功能目标链接到底层结构来提供表示系统行为的分层框架...

arXiv:2608.09921 2026-08-12 cs.AI

GENCO - 嵌入稳态电网分析开发框架的统一神经求解器

GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis

Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler

基础模型正在改变业务工作流程并提高生产力,,但它们在电力等工程领域中仍然基本上缺席......

arXiv:2608.07457 2026-08-11 cs.AI

交互创造了孤立中不存在的动态人工智能行为

Interaction Creates Dynamical AI Behavior Absent in Isolation

Bella Xinrui Li, Frank Yingjie Huo, Neil F Johnson

当人工智能代理在日常生活中交互时会发生什么,当一个 AI 开始在? 左右指挥另一个 AI 时,我们找到了一个违反直觉的答案,该答案打开...

arXiv:2608.06223 2026-08-10 cs.AIcs.LG

TS-RAG: 用于时间序列预测的检索增强生成

TS-RAG: Retrieval Augmented Generation for Time Series Forecasting

Yixiong Xiao, Congxi Xiao, Jingbo Zhou

虽然深度学习模型,尤其是基于变压器的架构,在时间序列预测,应用程序中表现出了令人印象深刻的性能...

arXiv:2608.06243 2026-08-10 cs.AI

DASH: 推理模型在策略自我蒸馏的散度自适应监督视野

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

具有可验证奖励的强化学习(RLVR) 使用自动可验证输出提高大型语言模型的推理能力...

arXiv:2608.06265 2026-08-10 cs.AIcs.DBcs.LG

提高实用性约束下综合临床基准的真实性

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

企业人工智能代理的综合临床基准可以通过现有的实用程序检查,但在结构上仍然不切实际,,尤其是在私人领域……

arXiv:2608.06270 2026-08-10 cs.AI

视觉工具使用的错觉: 用图像思考的因果审计

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

"thinking-with-images"范式为多模式法学硕士配备了主动视觉操作,例如裁剪和缩放。然而,模型使用这些操作...

arXiv:2608.06294 2026-08-09 cs.AIcs.ET

QuanTiMedAI: 由 Agentic AI 引导的量子增强时间序列模型,用于心脏骤停死亡率预测

QuanTiMedAI: Quantum-Enhanced Time-Series Model guided by Agentic AI for Cardiac Arrest Mortality Prediction

Mutasim Fuad Sarker, Adiba Rahman Namira, Wafa Binte Alam, Md Adnan Arefeen, Mahzabeen Emu, Sumaiya Tabassum Nimi

心脏骤停仍然是重症监护室遇到的最致命的情况之一。尽管电子医疗保健的可用性不断增加...

arXiv:2608.06300 2026-08-09 cs.AI

使用概念激活向量的 L2 口语评估系统的偏差分析

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

Arya Labroo, Mengjie Qian, Kate Knill

自动口语评估系统越来越多地部署在高风险环境中,以对第二语言(L2)学习者'口语测试,进行评分

arXiv:2608.06301 2026-08-09 cs.AIcs.CLcs.LG

HarnessOpt-Bench: 在 Harness Optimization 中评估法学硕士

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

随着法学硕士越来越多地部署在代理系统中,,他们的能力不仅取决于模型权重,还取决于工具:,提示...

arXiv:2608.06305 2026-08-09 cs.AIcs.CLcs.IR

超越 Top-K: 用可解释的代理操作取代黑盒检索

Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

Sagar Tamang, Ayush Vyas, Tabarakul Hazarika

长文档的检索增强生成主要由一种设计: 块文本, 嵌入块, 并显示 top-k 最近邻...

arXiv:2608.06346 2026-08-09 cs.AI

TRAJDEBUG: 跟踪错误生命周期以识别长期代理轨迹中的严重故障

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li

基于 LLM 的代理系统在复杂领域, 中表现出了卓越的能力,但同时也面临着级联错误和调试困难的问题。铬...

arXiv:2608.06351 2026-08-08 cs.AI

评估静态和变化数据解释方法的挑战

Challenges in Evaluating Explanation Methods for Static and Evolving Data

Jerzy Stefanowski

本文解决了可解释人工智能 (XAI) 在评估不足方面的局限性。它们通过...进行说明。

arXiv:2608.06361 2026-08-08 cs.AI

低频陷阱: 视频语言模型无法完成简单的事件记账

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

现实世界的视频基准测试提供了广泛的覆盖范围,,但其固定剪辑纠缠了事件计数, 速率, 持续时间, 和视觉复杂性, 导致失败......

arXiv:2608.06366 2026-08-08 cs.AIcs.LG

追踪心脏: 心力衰竭特征工程的循证管道

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

电子健康记录(EHR)特征工程是临床研究和AI,的主要瓶颈,占数据科学家'工作量的39-45%...

arXiv:2608.05102 2026-08-07 cs.AI

ABSeeker: 通过答案回溯信用分配训练长期搜索代理

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

长视野搜索代理必须执行多个连续操作 (steps) 来搜索, 检索, 验证, 并整合证据以获得最终答案。 ...

arXiv:2608.05107 2026-08-07 cs.AIcs.MAcs.SE

CoPlan: 一个值得信赖的协同智能界面,通过基于角色的可争议论证图来制定护理计划

CoPlan: A Trustworthy Co-Intelligence Interface for Care Planning through Role-Based Contestable Argument Graphs

Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

AI 支持的护理计划可以帮助临床医生, 患者, 护理人员, 和护理团队协调临床, 功能, 心理方面的复杂决策...

arXiv:2608.05141 2026-08-07 cs.AIcs.LGcs.SE

OctoLong: 跨存储库代码上下文的中期训练增强了长上下文建模

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

Indraneil Paul, Falko Helm, Goran Glavaš, Iryna Gurevych

语言模型 (LMs) 的上下文长度急剧增加,,这是由于上下文学习的需求, 自我改进, 和长期视野...

arXiv:2608.05144 2026-08-07 cs.AI

Argus: 用于长期任务的通用代理推理运行时

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

长视野推理需要一个代理运行时间,当证据支持其当前方法时,该运行时间可以持续存在,并且当测量结果显示错误时,该运行时间可以持续存在......

arXiv:2607.28580 2026-08-02 cs.AI

DualG-MRAG: 解耦宏观推理和微观匹配,实现多模态检索增强生成

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

虽然多模态检索增强一代 (MM-RAG) 已显示出有希望的结果,,但它仍然难以应对复杂的多跳推理任务。存在...

arXiv:2607.28609 2026-08-01 cs.AIcs.CLcs.CV

OSReward: 为跨平台计算机使用奖励模型建立标准化评估

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

使用计算机的代理 (CUA) 正在数字世界中快速发展。 CUA 轨迹记录了代理的 操作, 状态, 和推理。维里...

arXiv:2607.28617 2026-08-01 cs.AIcs.CLcs.CYcs.HC

AISPA: 以用户为中心的系统对大型语言模型应用程序进行及时审核

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

系统提示是开发人员配置的指令,用于管理人工智能应用程序中基础模型的行为。它们在整个公司中使用...

arXiv:2607.24649 2026-07-29 cs.AI

用于审核法学硕士社交模拟器的理性中介行为模型

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

Atharva Pandey, Gautam Jajoo

大型语言模型越来越多地用作社交模拟器,,包括用作综合调查受访者。大多数评估都会询问是否模拟...

arXiv:2607.24667 2026-07-29 cs.AI

驱逐作为估计: 测试时间内存, 以及测量节拍累积时的固定滞后平滑视图

Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating

Maruthi Vemula, Neeraj Praneeth Gajula

具有有限工作记忆的语言模型必须反复决定保留哪些存储项。每个部署的方法都会决定项目到达的那一刻...

arXiv:2607.24707 2026-07-29 cs.AIcs.CVcs.DB

ERUnderstand: 评估结构化 ER 图上的视觉语言模型

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

实体关系图 (ERDs) 是概念数据库设计的核心,,但它们通常仅作为渲染图像而不是主...

arXiv:2607.22525 2026-07-28 cs.AI

用于协助空中交通管制员的可解释强化学习

Explainable Reinforcement Learning for assisting Air Traffic Controllers

Anduel Mehmeti, Gabriella Gigante, Salvatore Venticinque

为了有效地将人工智能集成到高风险,关键环境中,例如医疗保健,自动驾驶,和航空——并朝着更高的方向前进......

arXiv:2607.21495 2026-07-27 cs.AIcs.ETcs.MA

持续保证工业界人工智能代理创建的民主化

Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry

Natan Levy, Harel Berger

人工智能代理越来越多地由非工程用户通过低代码,、无代码, 和对话式开发环境在组织内部创建......

arXiv:2607.21503 2026-07-27 cs.AIcs.IR

代理上下文管理: 通过将代理内存和成本视为生命周期和体系结构问题来解决它们

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

Gaurav Dadhich

生产型 AI 代理的故障较少是由于无法良好推理而导致的,而更常见的是因为他们无法管理推理中的内容......

arXiv:2607.21518 2026-07-27 cs.AI

相同的危险目标, 相反的建议: 直接暴露与多代理调解

Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

Linjun Li

即使是当前的高能力法学硕士,在直接显示危险目标时也会比其他代理转变并传递其方向时显得更安全......

arXiv:2607.21547 2026-07-27 cs.AIcs.CLcs.ETcs.LGcs.MA

自动化的边界: 人类持续参与理论

The Boundaries of Automation: A Theory of Persistent Human Participation

Fares Fourati, Hinrich Schütze, Eyke Hüllermeier, Iryna Gurevych

人工智能的快速进步强化了长期以来对自动化:的追求,尽可能用算法代替人类参与。进出口...

arXiv:2607.21552 2026-07-27 cs.AIcs.LG

MIRROR: 从其他视角学习多模态推理

MIRROR: Learning from the Other View for Multi-Modal Reasoning

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

与表现出强大推理能力的大型语言模型 (LLMs) 不同, 视觉语言模型 (VLMs) 即使在...上也很难进行视觉推理,

arXiv:2607.21557 2026-07-26 cs.AIcs.CL

OpenForgeRL: 任何环境下的列车线束原生代理

OpenForgeRL: Train Harness-native Agents in Any Environment

Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao

现代 AI 代理依靠复杂的推理工具(例如 Claude Code, Codex, 和 OpenClaw)来驱动多轮推理, 工具使用, 并访问...

arXiv:2607.21558 2026-07-26 cs.AI

超越阿谀奉承:法学硕士道德推理中的结构化抵抗和顺从

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

Baihui Wang, Bernard Koch

构建社会校准的大型语言模型,,它可以向他人学习,而不是简单地屈服于他们, 需要的不仅仅是减少阿谀奉承......

arXiv:2607.21559 2026-07-25 cs.AIcs.CEcs.ETstat.APstat.ML

加纳时空疟疾发病率的无监督共识异常检测

Unsupervised Consensus-Based Anomaly Detection for Spatiotemporal Malaria Incidence in Ghana

T. Ansah-Narh, Y. Asare Afrane

将共识异常检测框架应用于加纳(2014-2023) 的每月疟疾监测数据,以识别非典型传播模式...

arXiv:2607.20402 2026-07-24 cs.AI

SoftReason: 基于高维感知数据的完全可微神经软符号演绎推理架构

SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data

Wael AbdAlmageed

在许多推理问题, 中,前提并不是作为离散符号, 观察到的,而是必须从高维输入中推断出来。进一步,谓词...

arXiv:2607.19262 2026-07-23 cs.AI

BioSecBench-Surveillance: 病原体基因组监测中 AI 代理的可验证基准

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

随着病原体基因组监测规模扩大,,瓶颈正在从数据生成转向分析。我们提出 BioSecBench-Surveillance, 可验证...

arXiv:2607.19297 2026-07-23 cs.AIcs.SE

基于图形的代理 AI 与 LangGraph: 工作流程路径,适用于长期运行的有状态业务流程

Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes

Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola

本文是业务流程中长期运行, 有状态, 多步骤生成式人工智能系统的基于图的工作流程路径的从业者指南...

arXiv:2607.19300 2026-07-23 cs.AIcs.GT

LLM 检测作为干预: 战略用户行为下的下游影响

LLM Detection as an Intervention: Downstream Impact under Strategic User Behavior

Meena Jagadeesan, Tatsunori Hashimoto, Jon Kleinberg

随着 LLM 的采用变得更加广泛,,人们对检测 LLM 生成的内容, 越来越感兴趣,例如通过 LLM 检测工具和技术...

arXiv:2607.19321 2026-07-22 cs.AIcs.CRcs.LG

ResearchArena: 评估自动化 AI 中的破坏和监控 R&D

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

随着 AI 代理开始自动化 AI R&D,,我们需要方法来评估其输出是否可以安全部署,,即使代理本身可能不可信......

arXiv:2607.19327 2026-07-22 cs.AI

卷积神经网络中的联想情感学习

Associative Emotional Learning in Convolutional Neural Networks

Seowung Leem, Andreas Keil, Mingzhou Ding, Ruogu Fang

联想情绪学习使生物体能够适应性地将愉快或不愉快的结果与预测刺激的存在联系起来。而康...

arXiv:2607.19336 2026-07-22 cs.AIcs.CL

野外代理: 研究与部署的结合

Agents in the Wild: Where Research Meets Deployment

Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini

代理系统大型语言模型(LLM)基于架构,能够推理,规划,行动,并与工具和其他代理协调...

arXiv:2607.19338 2026-07-22 cs.AI

CodeRescue: 编码代理的预算校准恢复路由

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang

编码代理越来越多地在可执行环境中运行,其中失败的尝试会产生可操作的反馈,而不仅仅是错误的答案......

arXiv:2607.18116 2026-07-22 cs.AIcs.CVcs.GRcs.MAcs.MM

用于教育视频合成的 SGA: Plug&Play 几何验证

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

最近的工作利用大型语言模型 (LLMs) 使用 Manim 等库生成教学动画的可执行代码。然而,随之而来...

arXiv:2607.18228 2026-07-22 cs.AIcs.CL

压力下的逻辑判断: 使用习得的软前缀诊断三段论稳定性

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

Brian K Chen

为了测试正确的逻辑判断如何响应学习的上下文,,我们在精确标记的三段论推理基准之前添加一个软前缀,同时......

arXiv:2607.15142 2026-07-20 cs.AIcs.LG

改进 Atari Pong 中强代理背后的弱世界模型

Improving Weak World Models Behind Strong Agents in Atari Pong

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

强世界模型代理经常包含弱世界模型。我们通过在 A 中再现五个视觉世界模型代理来研究这种代理世界模型差距。

arXiv:2607.15164 2026-07-20 cs.AIcs.CY

人工智能驱动科学研究 ; 的产业化及其后果

The Industrialization of Research ; On AI-Driven Science and Its Consequences

Emmanuel Jeannot

人工智能正在改变科学研究——不仅作为一种更强大的工具,,而且作为研究的自主参与者......

arXiv:2607.15166 2026-07-20 cs.AIcs.CL

MedFailBench: 临床医生构建的医疗 AI 安全边界检查开源基准

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

Goktug Ozkan

大多数医疗人工智能基准测试都会衡量模型是否知道正确答案。 MedFailBench 提出了一个不同的问题: 哪个安全边界失败了? 我们...

arXiv:2607.15176 2026-07-20 cs.AIcs.CLcs.HC

科学可视化素养多模态大语言模型的基准测试

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

多模态大语言模型 (MLLMs) 越来越多地用于解释可视化,,但当前的评估仍然主要以图表为中心,并且...

arXiv:2607.15190 2026-07-20 cs.AI

我们可以相信人工智能评估的项目反应理论?

Can We Trust Item Response Theory for AI Evaluation?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

AI 基准越来越多地利用项目级统计模型, 特别是项目响应理论 (IRT), 来估计模型能力, 排名系统...

arXiv:2607.15193 2026-07-19 cs.AI

Plover: 通过以计划为中心的交互引导 GUI 代理

Plover: Steering GUI Agents through Plan-Centric Interaction

Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu

图形用户界面 (GUI) 自动化在现实环境中仍然具有挑战性,,其中动态布局, 意外对话框, 和不断发展的交互...

arXiv:2607.15202 2026-07-19 cs.AIcs.HCcs.MAcs.MM

用于可解释抑郁症症状注释的自我进化的以人为中心的框架

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

注释质量是为心理健康研究构建可靠且可解释的人工智能 (XAI) 系统的主要瓶颈。在深度...

arXiv:2607.15218 2026-07-19 cs.AIcs.CR

当言语安全但行动致命: 在隐藏状态风险空间中探索超越文本越狱的物理越狱

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

大型语言模型 (LLMs) 越来越多地充当具体代理的高级规划器,,其中语言上良性的指令可能变得不安全......

arXiv:2607.15247 2026-07-19 cs.AI

AutoSynthesis: 用于自动荟萃分析的代理系统

AutoSynthesis: An agentic system for automated meta-analysis

Moein Taherinezhad, Sebastian Maier, Gerardo Vitagliano, Francesco Pierri, Stefan Feuerriegel

证据综合对于将初级研究转化为科学, 医学, 教育, 和政策的可靠知识至关重要。然而,定量评估...

arXiv:2607.15254 2026-07-19 cs.AIcs.HC

告诉我为什么 (Ain't 除了堵塞): 对城市驾驶数据的探索性因果分析

teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data

Qiwei Li, Jorge Ortiz

交通机构现在可以访问大量视频数据来研究安全和拥堵情况。这些数据大部分是观察性的并且...

arXiv:2607.15257 2026-07-18 cs.AIcs.IR

SearchOS-V1: 实现强大的开放域信息搜索代理协作

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou

工具集成大型语言模型的最新进展使网络搜索成为信息查找代理的核心能力。然而,作为交互...

arXiv:2607.15267 2026-07-18 cs.AIcs.CL

预训练数据可能会通过计算宣传而被毒害

Pretraining Data Can Be Poisoned through Computational Propaganda

Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

破坏预训练数据可能会给 LM 带来难以检测和缓解的有害行为。先前关于中毒预训练数据的工作......

arXiv:2607.13013 2026-07-16 cs.AIcs.SD

使用冻结的离散扩散语言模型进行音频本机语音识别

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal

自动语音识别主要由一次发出一个标记的自回归解码器主导。我们问离散扩散语言模型是否......

arXiv:2607.13034 2026-07-16 cs.AIcs.CLcs.SEeess.SY

AI 代理是否知道任务何时简单? 进行复杂性感知推理和执行

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

Junjie Yin, Xinyu Feng

大型语言模型 (LLM) 代理越来越多地实现多步骤工程和信息学工作流程的自动化,,但他们很少询问一项任务需要付出多少努力...

arXiv:2607.08554 2026-07-13 cs.AI

CommuniWave:A 机器学习模型,用于量化城市社区临时非正式行为的程度

CommuniWave:A Machine Learning Model for Quantifying the Degree of Temporary Informal Behavior in Urban Communities

Hongye Yang, Shien Liu, Zhihao Xie

对于城市管理者和设计师, 改善城市社区的功能属性,以增强面对复杂性的领土弹性......

arXiv:2607.08573 2026-07-13 cs.AI

用于情绪和情绪识别的 SHAP 加权跨模态专家融合: 证据和限制

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

Adis Alihodzic, Selma Skopljakovic Hubljar

多模态情感和情感识别通常通过早期融合, 来解决,早期融合, 在分类, 或后期融合之前连接模态...

arXiv:2607.08602 2026-07-13 cs.AI

迈向肝细胞癌的精准治疗: 风险分层和治疗指导的临床推理法学硕士

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

肝细胞癌 (HCC) 是一种常见的恶性肿瘤,也是癌症相关死亡的主要原因。当前的指南和分期系统提供...

arXiv:2607.08625 2026-07-13 cs.AIcs.CL

以患者为中心的对话人工智能的复杂性

The complexities of patient-centred conversational artificial intelligence

João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar

由大型语言模型 (LLMs) 提供支持的面向消费者的健康聊天机器人越来越多地用于症状评估。然而, 聊天机器人开发和...

arXiv:2607.08652 2026-07-13 cs.AI

自利代理社会中市场稳定的正式机制: 市场模拟研究

Formal Mechanisms for Market Stability in Self-Interested Agent Societies: A Marketplace Simulation Study

Eugene Ng Yi Sheng, Bingquan Shen

自私的代理人,不受约束,倾向于在重复的社会困境中叛逃,,导致贸易合作收益崩溃。这 ...

arXiv:2607.08681 2026-07-12 cs.AIcs.ETcs.LGcs.MAecon.GN

SolarChain-Eval: 去中心化能源市场中值得信赖的经济主体的物理约束基准

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

Shilin Ou, Yifan Xu, Luyao Zhang

随着代理人工智能系统越来越多地应用于网络物理环境,,他们的评估需要评估任务绩效和信任......

arXiv:2607.08716 2026-07-12 cs.AIcs.CL

记住重要时刻: 用于长视野代理的主动内存代理

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao

在长期任务中,, 决策相关状态通常分散在不断扩展的轨迹, 上,而行动代理必须将其浮现出来并采取行动。作为...

arXiv:2607.08734 2026-07-12 cs.AI

法学硕士中量化效应的等效性:统计特征的错觉

The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs

Baha Rababah, Shahzeb Qamar, Lorenz Sparrenberg, Rafet Sifa, Murat Kantarcioglu, Cuneyt Gurcan Akcora, Carson K. Leung

训练后量化已广泛用于压缩大型语言模型,使其可部署在资源受限的设备上。然而,...

arXiv:2607.08740 2026-07-11 cs.AIcs.PLcs.SE

工作流作为知识: 以 LLM 为中介的工作流的语义持久性

Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows

Emanuele Quinto, Carlo Andrea Rozzi, Francesco Zanitti

大型语言模型 (LLM) 应用程序越来越多地使用显式工作流程来进行工具使用, 检索, 分支, 检查点, 和人工审批。埃西...

arXiv:2607.08745 2026-07-11 cs.AIcs.CV

AUTOPILOT VQA: 对以事件为中心的行车记录仪理解的视觉语言模型进行基准测试

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

视觉语言模型,大型语言模型,和多模态大型语言模型的最新进展改善了自动驾驶任务,例如......

arXiv:2607.08748 2026-07-11 cs.AIcs.HC

在高等教育中使用基于人工智能的学习助手: 大规模描述性分析

Using AI-based Learning Assistants in Higher Education: A Large-Scale Descriptive Analysis

Kristina Schaaff, Quintus Stierstorfer, Valerie Hekkel

在这项研究,中,我们对基于人工智能的学习助手(Syntea)在高等教育中的使用进行了大规模的描述性分析。基于对象...

arXiv:2607.08758 2026-07-11 cs.AI

想法有基因组: 基准科学谱系推理和基于谱系的想法生成

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang

科学思想很少是从白纸开始的。他们继承了机制, 修复已知的局限性, 并重新组合早期工作, 的各个部分,就像双...

arXiv:2607.07695 2026-07-10 cs.AIcs.GTcs.MA

机构红队: 部署规则, 不仅仅是模型, 因果塑造多代理人工智能安全

Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety

Yujiao Chen

我们引入机构红队,一种用于测试多智能体AI中的部署规则的评估方法:持有代理,目标,和任务...

arXiv:2607.06519 2026-07-09 cs.AI

FreqDepthKV: 频率引导深度共享,用于长上下文 LLM 推理中的鲁棒 KV 缓存压缩

FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

长上下文 LLM 推理越来越受到 KV 缓存, 的内存和带宽成本的限制,但积极的压缩可以消除层规范...

arXiv:2607.06522 2026-07-09 cs.AIcs.CV

通过视觉动作结果推理对齐连接物理推理和任务概括

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

视觉语言模型 (VLMs) 很难在交互式物理推理, 中进行泛化,特别是在看不见的任务和环境下。两把钥匙失效了...

arXiv:2607.06523 2026-07-09 cs.AI

用于长上下文 KV 缓存压缩的 DepthWeave-KV: 令牌自适应跨层残差分解

DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera

长上下文语言模型推理越来越受到存储键值缓存所需的内存带宽和容量的限制, 但现有的 co...

arXiv:2607.06531 2026-07-09 cs.AIcs.LG

大型癌症助手 (LCA): 与模型无关的编排框架,用于肿瘤学中可扩展的临床决策支持

The Large Cancer Assistant (LCA): A Model-Agnostic Orchestration Framework for Scalable Clinical Decision Support in Oncology

Ghassen Marrakchi, Basarab Matei

- Objective: 肿瘤学中的多模态深度学习模型目前受到严格耦合数据摄取的整体设计的限制, 临床路线...

arXiv:2607.06544 2026-07-09 cs.AIcs.CL

从文化遗产保护的角度重新思考印度人工智能

Rethinking Indic AI from a Lens of Cultural Heritage Preservation

Aparna Madva, Sharath Srivatsa, Srinath Srinivasa, Tulika Saha

随着人工智能(AI) 进入印度次大陆, 的不同地区,人们对研究人工智能如何影响......产生了浓厚的兴趣。

arXiv:2607.05359 2026-07-08 cs.AI

图稀疏采样:打破连续MDP规划中的地平线诅咒

Graph Sparse Sampling: Breaking the Curse of the Horizon in Continuous MDP Planning

Idan Lev-Yehudi, Vadim Indelman

在连续域的不确定性下进行规划对于自治系统, 至关重要,但计算要求较高。基于树的搜索方法,例如...

arXiv:2607.05363 2026-07-08 cs.AI

SovereignPA-Bench: 在不断变化的意图, 平台中介, 和同意约束下评估用户拥有的个人代理

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

Dylan Zongmin Liu

个人代理正在成为持久的用户拥有的中介: 他们记住偏好, 过滤平台介导的信息, 使用工具, 并否定...

arXiv:2607.05391 2026-07-08 cs.AIcs.CLcs.LGcs.MAcs.RO

LLM-as-a-Verifier: 通用验证框架

LLM-as-a-Verifier: A General-Purpose Verification Framework

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

扩展训练前,、训练后, 和测试时计算已成为提高法学硕士能力的核心范例。在这项工作,中,我们...

arXiv:2607.02303 2026-07-07 cs.AI

线性注意力的海马体: 循环状态忘记的精确记忆

A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets

Wanyun Cui

线性注意力和状态空间语言模型将前缀压缩为固定大小的循环状态,,以有损前的代价产生 O(1) 内存...

arXiv:2607.02329 2026-07-07 cs.AI

扎根的自主研究: 前沿计算物理中从语料库到手稿的容错法学硕士管道

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

Haonan Huang

自主研究代理已经在机器学习沙箱中展示了端到端的法学硕士自动化,其中执行提供了校准。前沿PH...

arXiv:2607.02374 2026-07-07 cs.AI

DRIFTLENS: 测量个性化语言模型中记忆引起的推理漂移

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

个性化改变了模型对用户所说的内容; 我们表明,它还可以改变用于证明响应合理性的推理轨迹。现代法学硕士...

arXiv:2607.02376 2026-07-07 cs.AIcs.MA

安全关键型实时自治系统的硬件强制语义协调

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

代理人工智能的最新进展正在产生日益复杂的自主系统,这些系统集成了大型语言模型,世界模型,优化e...

arXiv:2607.02389 2026-07-06 cs.AIcs.CRcs.SE

通过约束的可操纵性: 是编码代理可扩展监督的基础

Steerability via constraints: a substrate for scalable oversight of coding agents

Thomas Winninger

编码代理有能力; 人类监督是瓶颈。不受约束的代理会带来安全风险, 侵蚀代码库可扩展性, 并使人...

arXiv:2607.02396 2026-07-06 cs.AIcs.LG

通过 RFM-AGOP 的快速多维拒绝子空间

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

Thomas Winninger

大型语言模型 (LLMs) 中的引导和监控激活越来越多地用于安全性和可解释性。早期的工作假设是...

arXiv:2607.02407 2026-07-06 cs.AIcs.CV

非曼哈顿环境中文本驱动的 3D 室内场景合成

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments

Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao

大型语言模型 (LLMs) 在曼哈顿环境的 3D 室内合成中表现出了卓越的能力。然而,现有方法...

arXiv:2607.02432 2026-07-05 cs.AIcs.CLcs.CY

使用大型语言模型对 Linux/bash 考试进行自动评分: 四级认知分类方法

Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J.Rodriguez-Martinez, Lorena Otero-Cerdeira

命令行考试的可扩展且可靠的评分仍然是计算教育, 中的一个挑战,其中入学人数的增加使得手动评分变得困难...

arXiv:2607.02440 2026-07-05 cs.AIcs.CL

EvoPolicyGym: 评估交互式环境中的自主策略演化

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang

人们越来越期望自主代理通过反馈来改进可执行政策,,但现有的评估经常将这一过程分解为……

arXiv:2607.02491 2026-07-05 cs.AI

G-RRM: 使用递归推理模型指导符号求解器

G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models

Timo Bertram, Sidhant Bhavnani, Richard Freinschlag, Erich Kobler, Andreas Mayr, Günter Klambauer

在这项工作, 中,我们重点关注 SE-RRM,,这是 RRM 的符号等变实例,它对更大的问题规模表现出改进的外推能力。我们建议...

arXiv:2607.02507 2026-07-05 cs.AIcs.CLcs.LGcs.MA

当没有人在看时,LLM 代理人会说什么: 社会结构和多代理人辩论中潜在客观出现

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

LLM 代理人将越来越多地在社会结构环境中行动,其中角色, 受众, 和关系背景可以决定什么是有利的或昂贵的......

arXiv:2607.02509 2026-07-05 cs.AI

ReContext: 递归证据重放作为 LLM 工具进行长上下文推理

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He

对长上下文的理解和推理已成为在实际应用程序中部署大型语言模型 (LLMs) 的关键要求。阿尔斯...

arXiv:2607.02510 2026-07-04 cs.AIcs.CLcs.LGstat.APstat.ML

法学硕士在线安全监控

Online Safety Monitoring for LLMs

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

尽管进行了对齐培训,, LLM 仍然容易在部署时生成不安全的输出。在线监控输出并在安全时发出警报...

arXiv:2607.02514 2026-07-04 cs.AI

持久状态人工智能控制中的分布式攻击

Distributed Attacks in Persistent-State AI Control

Josh Hills, Ida Caspary, Asa Cooper Stickland

随着人工智能编码代理变得更加自主,,他们越来越多地迭代地交付代码,,并且代码库在会话之间持续存在。这种坚持让...

arXiv:2607.01223 2026-07-03 cs.AIcs.CLcs.LGcs.LOcs.SE

Theoria: 对非正式推理状态的重写可接受性验证

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

Michael Saldivar, Ben Slivinski

人工智能系统的 的答案何时应该可信? 形式证明助手提供确定性,但无法达到大部分问题分布; 标量法学硕士...

arXiv:2607.01224 2026-07-03 cs.AIcs.CLcs.MA

AutoMem: 自动学习记忆作为一种认知技能

AutoMem: Automated Learning of Memory as a Cognitive Skill

Shengguang Wu, Hao Zhu, Yuhui Zhang, Xiaohan Wang, Serena Yeung-Levy

记忆专业知识是一种习得的技能:知道要编码什么,何时检索,以及如何组织知识——这种能力在认知科学中被称为……

arXiv:2606.30626 2026-07-01 cs.AI

DOPD: 双同政策蒸馏

DOPD: Dual On-policy Distillation

Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan

在策略蒸馏 (OPD) 通过使用密集的令牌级信号监督学生采样轨迹,提供卓越的容量传输。提供...

arXiv:2606.30639 2026-07-01 cs.AIcs.CL

LLM代理规划的自我进化世界模型

Self-Evolving World Models for LLM Agent Planning

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

世界模型提供了一种原则性的方法,使长期 LLM 代理在执行前对行动后果具有远见: 的预测。然而,不...

arXiv:2606.27226 2026-06-29 cs.AIcs.CL

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit Sahu

评估 LLM 输出仍然是 NLP 的主要瓶颈: 人类评估成本昂贵且缓慢, 词汇指标与人类判断相关性很​​差......

arXiv:2606.27277 2026-06-28 cs.AIcs.CV

EO-WM: 用于概率地球观测预测的物理信息世界模型

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

地球观测(EO)预测旨在根据不断变化的气象条件下的卫星观测来预测未来地球表面的动态......

arXiv:2606.27286 2026-06-28 cs.AI

流行病学模型中基于模拟的快速贝叶斯参数估计: 与 MCMC 的比较

Simulation-based inference for rapid Bayesian parameter estimation in epidemiological models: a comparison with MCMC

Alina Bazarova, Johann Fredrik Jadebeck, Henrik Zunker, Carolina J. Klett-Tammen, Torben Heinsohn, Wolfgang Wiechert, Katharina Noeh, Stefan Kesselheim

机制流行病学模型广泛用于支持传染病预测和公共卫生决策。贝叶斯校准...

arXiv:2606.27287 2026-06-27 cs.AI

使用大型语言模型: 单次和多次注射设置进行自动 Résumé 筛选中的提示注射

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

大型语言模型 (LLMs) 越来越多地用于筛选和排名求职者, 为候选人战略性地操纵...

arXiv:2606.27288 2026-06-27 cs.AIcs.LG

组合语言模型何时有助于? 路由, 投票, 和跨 67 个前沿模型的代理混合的共同失败上限

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

Josef Chen

多模型 LLM 系统(例如路由, 投票, 级联, 融合, 和混合代理)用于击败单模型准确性。我们表明他们的...

arXiv:2606.27334 2026-06-27 cs.AI

用于老年人认知援助的基于语言的数字孪生

Language-Based Digital Twins for Elderly Cognitive Assistance

Mohammad Mehdi Hosseini, Mohammad H. Mahoor, Hiroko H. Dodge

数字孪生已成为个性化医疗保健的一个有前途的范例,,可以对个人行为和健康轨迹进行建模。在c...

arXiv:2606.25996 2026-06-26 cs.AIcs.CLcs.LG

Autodata: 代理数据科学家,创建高质量的合成数据

Autodata: An agentic data scientist to create high quality synthetic data

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

我们引入了 Autodata, 一种通用方法,使 AI 代理能够充当构建高质量训练和评估数据的数据科学家。我们展示...

arXiv:2606.26057 2026-06-26 cs.AIcs.CRcs.LG

不可激发的安全内核: 用于 AI 代理和其他可逃逸 AI 系统的执行时 AI 对齐

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

Seth Dobrin, Łukasz Chmiel

AI 代理被授予对工具, API, 和其他基础设施, 的访问权限,使它们成为这些系统中的活跃主体。占主导地位的方法将...

arXiv:2606.24855 2026-06-25 cs.AI

OpenThoughts-Agent: 代理模型的数据配方

OpenThoughts-Agent: Data Recipes for Agentic Models

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

代理语言模型极大地扩展了人工智能的应用,但公众对如何为具有广泛能力的培训数据进行管理却知之甚少……

arXiv:2606.23643 2026-06-23 cs.AI

TailorMind: 致力于生成偏好一致的多模式内容

TailorMind: Towards Preference-Aligned Multimodal Content Generation

Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie

个性化内容系统依赖于可用的 UGC,当缺乏合适的内容, 延迟, 或创建成本高昂时,就会陷入困境。虽然多式联运...

arXiv:2606.23672 2026-06-23 cs.AI

教授法学硕士字符串匹配,回溯,和错误恢复来推导组合爆炸位操作难题的基数和真值表

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

本文介绍了我们针对 NVIDIA Nemotron 模型推理挑战, 的算法创新,重点关注位操作难题。在此任务中,...

arXiv:2606.23673 2026-06-23 cs.AIcs.LG

PsyBridge: 用于多维心理健康评估和决策支持的混合智能框架

PsyBridge: A Hybrid Intelligent Framework for Multi-Dimensional Mental Health Assessment and Decision Support

Sunil Wanjari, Manish Thakre, Aayushi Asole, Sharwari Raut, Kwabena Adu-Duodu, Yinhao Li, Stanly Wilson

心理健康评估通常依赖于孤立的筛查工具或数据驱动的模型,而这些工具往往缺乏可解释性和多维度...

arXiv:2606.20363 2026-06-23 cs.AI

通过交互轨迹挖掘自动生成计算机使用代理的 SKILL.md

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

Yuexing Hao, Xiaomin Li

显式技能库使使用计算机的代理更容易检查,,但仍不清楚是否可以从交互数据中挖掘此类库......

arXiv:2606.20381 2026-06-23 cs.AI

重新思考 LLM FP4 预训练中的收缩偏差: 几何起源, 系统影响, 和 UFP4 配方

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

FP4 训练有望大幅降低 LLM 预训练, 的内存和计算成本,但当前的 FP4 硬件路径和配方, 包括...

arXiv:2606.20438 2026-06-23 cs.AI

通过注意力引导深度学习进行可解释的精子形态分类

Interpretable Sperm Morphology Classification via Attention-Guided Deep Learning

Zahra Asghari Varzaneh, Reza Khoshkangini, Thomas Ebner, Lars Johansson

男性不育是夫妻不育的主要原因, 通常与精子形态异常有关。虽然深度学习模型提供自动化分析...

arXiv:2606.20459 2026-06-23 cs.AI

IVF 实验室环境条件的上下文感知分层贝叶斯建模

Context-Aware Hierarchical Bayesian Modeling of IVF Laboratory Environmental Conditions

Zahra Asghari Varzaneh, Reza Khoshkangini, Pia Saldeen, Lars Johansson, Thomas Ebner

IVF 妊娠率通常使用患者水平变量, 进行建模,而高分辨率实验室环境数据仍未得到充分利用。我们 ...

arXiv:2606.20508 2026-06-22 cs.AIcs.LG

与安全相关的法学硕士可以从混合合规演示中学到什么?

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?

Sihui Dai, Mann Patel

先前的工作表明,上下文演示可以越狱语言模型,,但仍不清楚模型如何解释不同类型的计算机...

arXiv:2606.20517 2026-06-21 cs.AIcs.PL

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

LiveCodeBench (LCB) 最近已成为广泛采用的基准,用于在代码生成任务上评估大型语言模型 (LLMs)。通过策划...

arXiv:2606.20518 2026-06-21 cs.AI

FlowEdit: 用于流程匹配 TTS 中终生发音适应的联想记忆

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

Harshit Singh, Ayush Pratap Singh, Nityanand Mathur

流匹配文本到语音系统实现了卓越的零样本质量,但在部署后保持静态: 词汇外发音错误...

arXiv:2606.20526 2026-06-21 cs.AI

用于神经概率逻辑程序的 DeepSWIP: 商 WMC 反事实

DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs

Saimun Habib, Vaishak Belle, Fengxiang He

DeepProbLog 等神经符号系统将神经感知与概率逻辑相结合,,但标准推理是关联的。反事实...

arXiv:2606.20529 2026-06-21 cs.AIcs.CL

LedgerAgent: 符合策略的工具调用代理的结构化状态

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

客户服务域中遵守策略的工具调用代理必须在调用工具并遵守域策略的同时保持轮流任务状态......

arXiv:2606.20532 2026-06-20 cs.AI

指令如何塑造语音? 样式标题文本转语音的交叉注意归因

How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

Nityanand Mathur, Hamees Sayed, Wasim Madha, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

样式字幕文本转语音系统使用自然语言来控制语音特征,,但单个单词如何影响声音输出仍然是......

arXiv:2606.20544 2026-06-20 cs.AIcs.LG

走向分布转移下的校准专家组合

Toward Calibrated Mixture-of-Experts Under Distribution Shift

Gina Wong, Drew Prinster, Suchi Saria, Rama Chellappa, Anqi Liu

校准将模型的的预测不确定性与其经验结果的频率保持一致,对于理解和信任代表很重要......

arXiv:2606.19245 2026-06-19 cs.AIcs.LG

TxBench-PP: 分析 AI 药物在小分子临床前药理学上的性能

TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

人工智能(AI)代理承诺通过压缩解释和决策循环来加速药物发现,但实际部署...

arXiv:2606.19256 2026-06-19 cs.AI

X+Slides: 基准测试观众条件幻灯片生成

X+Slides: Benchmarking Audience-Conditioned Slide Generation

Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

从源文档自动生成幻灯片是大型语言模型(LLMs) 的一个重要应用。现有基准主要...

arXiv:2606.19279 2026-06-19 cs.AIcs.LGcs.LOmath.CTmath.LOmath.PR

NeSyCat Torch: 用于神经符号学习的分类语义的可微张量实现

NeSyCat Torch: A Differentiable Tensor Implementation of Categorical Semantics for Neurosymbolic Learning

Daniel Romero Schellhorn, Till Mossakowski, Björn Gehrke

神经符号语义是支离破碎的:经典,模糊,概率和神经系统每个都通过自己的归纳规则定义真理。 NeSyCat, 扩展...

arXiv:2606.19327 2026-06-19 cs.AIcs.CL

重新思考奖励监督: 条件自蒸馏

Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation

Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying

推理语言模型的后训练通常由具有可验证奖励的监督蒸馏和强化学习驱动。蒸馏...

arXiv:2606.18206 2026-06-18 cs.AI

定点 Reasoners: 稳定且自适应的深环变压器

Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers

Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Rusch, Antonio Orvieto

循环架构为学习需要组合推理的任务的逐步过程提供了归纳偏差。电子数量...

arXiv:2606.18235 2026-06-18 cs.AI

EvolveNav: 用于零射击目标导航的主动预反射和自进化记忆

EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation

Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang

零射击对象目标导航 (ZS-OGN) 需要具体代理在没有任何事先训练的情况下探索和定位目标对象。为此,最近...

arXiv:2606.16995 2026-06-17 cs.AIcs.LG

如有疑问, 计划好: 致力于反应式强化学习的小语言模型审议

When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

强化学习 (RL) 策略在不熟悉的环境中通常会退化,因为它们缺乏明确的深思熟虑。我们建议计划, 对齐, 提交,...

arXiv:2606.17005 2026-06-17 cs.AIstat.ME

前沿人工智能评估公共档案的贝叶斯推理和决策审计

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

Yanan Long

公共人工智能评估通常被解读为终端排行榜,,但潜在的证据是由报告规则, 基准形成的选择性时间序列...

arXiv:2606.14579 2026-06-16 cs.AI

VISTA: GUI 基础的视图一致自我验证培训

VISTA: View-Consistent Self-Verified Training for GUI Grounding

Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

当应用组相对策略优化 (GRPO) 进行 GUI 基础时, 部署是从单个屏幕截图视图中采样的; 组通常变得...

arXiv:2606.14582 2026-06-16 cs.AI

异构铁路系统中中断感知动态路线优化的时间规划框架

A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems

Pollob Chandra Ray, Sabah Binte Noor, Fazlul Hasan Siddiqui

高效的线路优化对于确保铁路运营的安全和准点起着至关重要的作用。这是非常重要的,特别是在异国情调...

arXiv:2606.14654 2026-06-16 cs.AIcs.CLcs.LG

将跨域操作序列抽象为可解释的工作流程

Abstracting Cross-Domain Action Sequences into Interpretable Workflows

Gaurav Verma, Scott Counts

顺序或带时间戳的交互日志提供了数字应用程序使用情况的客观记录,,但它们的粒度和噪音常常掩盖了平均值...

arXiv:2606.14672 2026-06-16 cs.AIcs.CL

LLM-Agent 工作流程中并行分支的直接潜在空间综合

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

大型语言模型越来越多地充当代理系统,的执行引擎,但它们仍然通过顺序文本接口消耗上下文......

arXiv:2606.13604 2026-06-15 cs.AIcs.LGcs.MA

三边调度中目标权重适应的延迟市场反馈的多代理强化学习

Multi-Agent Reinforcement Learning from Delayed Marketplace Feedback for Objective-Weight Adaptation in Three-Sided Dispatch

Haochen Wu, Yi Hou, Shiguang Xie

三边市场中的调度为从世界反馈中进行强化学习提供了一个自然的环境: 决策是通过延迟操作来评估的...

arXiv:2606.13607 2026-06-15 cs.AI

推理作为模式匹配: 人类和法学硕士日常推理的共享机制

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

Zach Studdiford, Gary Lupyan

当大型语言模型 (LLMs) 无法泛化或在推理中出现偶然错误, 时,通常会被视为 LLM 并不真正可靠的证据...

arXiv:2606.13608 2026-06-15 cs.AIcs.LG

AgentBeats: 代理评估的开放性, 标准化, 和可重复性

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

代理系统正在跨领域快速发展,,但它们的评估仍然分散。大多数基准测试都依赖于固定, LLM 中心的工具,这些工具...

arXiv:2606.13621 2026-06-15 cs.AIcs.CRcs.GTcs.LGcs.MA

超越运行时执行: Shield Synthesis 作为对抗网络的防御性分析

Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks

Achraf Hsain, Sultan Almuhammadi

屏蔽强化学习通常被视为一种运行时安全机制,它将时间逻辑规范编译成自动机限制...

arXiv:2606.13658 2026-06-15 cs.AI

未雨绸缪: 系统 0, 人工智能介导的认知和认知殖民

Before You Think: System 0, AI-Mediated Cognition and Cognitive Colonization

Marianna Bergamaschi Ganapini, Massimo Chiriatti, Enrico Panai, Giuseppe Riva

本文研究了用于理解人工智能的认知和认知后果的三个最新框架: 三系统理论, ...

arXiv:2606.13662 2026-06-14 cs.AIcs.CL

EurekAgent: 代理环境工程是您自主科学发现所需的一切

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

基于法学硕士的代理在自动化科学发现方面显示出越来越大的潜力。给定一个可优化的指标和一个执行环境,,他们可以...

arXiv:2606.13669 2026-06-14 cs.AI

Agents-K1: 迈向代理原生知识编排

Agents-K1: Towards Agent-native Knowledge Orchestration

Zongsheng Cao, Bihao Zhan, Jinxin Shi, Jiong Wang, Fangchen Yu, Zhijie Zhong, Yingnan Han, Zijie Guo, Tianshuo Peng, Zhuo Liu, Yi Xie, Xiang Zhuang, Shengji Tang, Yue Fan, Runmin Ma, Shiyang Feng, Xiangchao Yan, Anran Liu, Peng Ye, Wenlong Zhang, Xiaosong Wang, Shufei Zhang, Chunfeng Song, Fenghua Ling, Jie Zhou, Liang He, Bo Zhang, Lei Bai

目前基于 LLM 的研究代理已经通过代理编排, 取得了进步,但在很大程度上忽视了科学知识编排。现有作品...

arXiv:2606.13670 2026-06-13 cs.AI

使用大型语言模型对社会和行为科学进行自动再现性评估

Automated reproducibility assessments in the social and behavioral sciences using large language models

Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, Felix Henninger, Stefan Rose, Sarah Ball, Bolei Ma, Frauke Kreuter, Markus Weinmann, Stefan Feuerriegel

社会和行为科学中的可重复性通常由独立研究人员进行评估,他们重新分析原始数据以评估...

arXiv:2606.09809 2026-06-10 cs.AI

评估卡: AI 评估报告的解释层

Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting

Avijit Ghosh, Anka Reuel, Jenny Chim, Wm. Matthew Kennedy, Srishti Yadav, Jennifer Mickel, Yanan Long, Andrew Tran, Anastassia Kornilova, Damian Stachura, Kevin Klyman, Felix Friedrich, Jeba Sania, Jan Batzner, Anoop Mishra, Eliya Habba, Yixiong Hao, Nathan Heath, Shalaleh Rismani, Usman Gohar, Andrea Loehr, David Manheim, Ruchira Dhar, Sree Harsha Nelaturu, Aarush Sinha, Leshem Choshen, Drishti Sharma, Ishan Khire, Amit Saha, Subramanyam Sahoo, Michael Hardy, Michael Alexander Riegler, Kabir Manghnani, Michelle Lin, Yanan Jiang, Yilin Huang, Asaf Yehudai, Jessica Ji, Aris Hofmann, Mubashara Akhtar, Max Lamparth, Nuno Moniz, Yacine Jernite, Stella Biderman, Zeerak Talat, Sanmi Koyejo, Mykel Kochenderfer, Irene Solaiman

AI 评估结果是大规模产生的,但在排行榜, 模型卡, 基准论文, 和公司博客中报告不一致。科斯...

arXiv:2606.07462 2026-06-09 cs.AI

充当真正的研究人员: 评估研究生命周期中的前沿法学硕士和代理工具的一套基准

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao

随着基础模型的进步和智能体支架变得越来越复杂, 智能体已经在复杂的, 领域表现出了卓越的熟练程度...

arXiv:2606.07489 2026-06-09 cs.AIecon.GN

AI 代理如何重塑知识工作: 自主性, 效率, 和范围

How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope

Jeremy Yang, Kate Zyskowski, Noah Yonack, Jerry Ma

前沿人工智能系统正在通过从对话助理转变为执行......的自主代理来缩小智能和实用之间的差距。

arXiv:2606.06356 2026-06-08 cs.AI

知识应该进入哪里? 多模态迭代生成模型中知识注入的分层框架

Where Should Knowledge Enter? A Layered Framework for Knowledge Infusion in Multimodal Iterative Generative Model

Renjith Prasad, Chathurangi Shyalika, Anushka Pawar, Aahan Rathod, Amit Sheth

多模态生成模型可产生流畅的输出,但当生成必须尊重结构化,、特定领域, 或安全关键时,仍然不可靠...

arXiv:2606.06360 2026-06-08 cs.AI

基于大语言模型决策的传染病传播模拟

An Infectious Disease Spread Simulation Based on Large Language Model Decision Making

Yonchanok Khaokaew, Ruochen Kong, Andreas Zufle, Hao Xue, Taylor Anderson, Chandini Raina MacIntyre, Matthew Scotch, Flora D. Salim, David J Heslop

在传染病爆发期间对个人决策进行建模对于理解行为动态和为有效的公共信息提供信息至关重要...

arXiv:2606.06375 2026-06-08 cs.AI

重新思考基础设施检查作为图像差异分类: 交通标志案例研究

Rethinking Infrastructure Inspection as Image Difference Classification: A Traffic Sign Case Study

Ching Yau Fergus Mok, Lavindra de Silva, Varun Kumar Reja, Ioannis Brilakis

数字孪生(DTs) 允许道路基础设施检查, 数字化,尽管这受到有限注释数据的阻碍。这项工作利用了...

arXiv:2606.06388 2026-06-08 cs.AIcs.CL

Humans ALMANAC: 用于代理协作的动作级心理模型注释的人类协作数据集

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

LLM 代理的最新进展实现了复杂的认知能力,,例如多步推理, 规划, 和工具使用,,这越来越多地...

arXiv:2606.06396 2026-06-07 cs.AI

自动驾驶的风险评估: 整合技术故障, 道德困境, 和政策框架

Risk Assessment of Autonomous Driving: Integrating Technical Failures, Ethical Dilemmas, and Policy Frameworks

Boyi Chen, Shengqin Chu, Zicheng Wang, Brian Baetz, Zhen Gao

自动驾驶技术有潜力减少每年因人为失误造成的大量道路交通事故,,但它也带来了...

arXiv:2606.06416 2026-06-07 cs.AIcs.CLcs.LGcs.MA

用于代理数据分析的无监督技能发现

Unsupervised Skill Discovery for Agentic Data Analysis

Zhisong Qiu, Kangqi Song, Shengwei Tang, Shuofei Qiao, Lei Liang, Huajun Chen, Shumin Deng

推理时技能增强提供了一种轻量级的方法来改进数据分析代理,通过注入可重用的程序知识而无需更新...

arXiv:2606.06448 2026-06-05 cs.AI

有状态长期工作负载的代理内存: 特征和系统影响

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe

LLM 智能体越来越多地部署在需要对长期交互历史进行持续推理的长期任务上。大规模地意识到这一点......

arXiv:2606.06453 2026-06-05 cs.AI

Vortex: 为 AI 代理提供高效且可编程的稀疏注意力服务

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

随着生成长度的不断增长,稀疏注意力对于服务大型语言模型 (LLMs) 变得越来越重要。然而, 部署...

arXiv:2606.06462 2026-06-05 cs.AI

一次性对所有地方的所有内容进行基准测试

Benchmark Everything Everywhere All at Once

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

基准通过提供标准化和明确的绩效衡量标准,是评估和推进 LLM 和 MLLM 的基础。然而,他们的...

arXiv:2606.06468 2026-06-05 cs.AI

Goedel-Architect: 通过蓝图生成和细化简化形式定理证明

Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement

Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora

我们引入了 Goedel-Architect, ,这是一个在 Lean 4 中以蓝图生成和细化为中心的形式定理证明的代理框架。一张蓝图...

arXiv:2606.06473 2026-06-05 cs.AIcs.CL

MLEvolve: 用于自动机器学习算法发现的自我进化框架

MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai

大型语言模型 (LLM) 代理越来越多地应用于长期任务,例如科学发现和机器学习工程 (MLE), ...

arXiv:2606.05104 2026-06-05 cs.AI

诺亚的方舟知识索引

Knowledge Index of Noah's Ark

Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang

LLM 的知识基准面临三个问题: 扩展驱动的设计无法实现学科代表性; 固定付款注释...

arXiv:2606.02530 2026-06-03 cs.AIcs.CL

SafeSteer: 本地化合规蒸馏,实现高效安全调整

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

将大型语言模型 (LLMs) 与人类价值观保持一致通常会降低其一般能力,,称为对齐税。现有方法减轻了...

arXiv:2606.02536 2026-06-03 cs.AI

跟踪适应代理的行为轨迹

Tracking the Behavioral Trajectories of Adapting Agents

Jonah Leshin, Manish Shah, Ian Timmis

诸如技能文件, 内存文件, 和行为配置文件之类的文本文件在定义现代代理的行为方式方面发挥着核心作用。通过编辑...

arXiv:2606.02568 2026-06-03 cs.AIcs.CLcs.ETcs.MA

ClinEnv: 代理的交互式多阶段长期 EHR 环境

ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents

Yuxing Lu, Yushuhong Lin, Wenqi Shi, J. Ben Tamo, Xukai Zhao, Jinzhuo Wang, May Dongmei Wang

临床实践不是从列举的选项中选择答案: 医生逐渐收集异构信息并致力于...

arXiv:2605.31468 2026-06-02 cs.AI

AutoSci: 用于整个科学研究生命周期的以内存为中心的代理系统

AutoSci: A Memory-Centric Agentic System for the Full Scientific Research Lifecycle

Weitong Qian, Beicheng Xu, Zhongao Xie, Bowen Fan, Guozheng Tang, Jiale Chen, Xinzhe Wu, Mingtian Yang, Chenyang Di, Jiajun Li, Lingching Tung, Peichao Lai, Yifei Xia, Ziyi Guo, Yanwei Xu, Yanzhao Qin, Shaoduo Gan, Xupeng Miao, Bin Cui

科学研究传统上是人力密集型,,要求研究人员协调文献, 想法, 实验, 手稿, 和评论...

arXiv:2605.31492 2026-06-02 cs.AI

LinTree: 通过显式结构化搜索历史改进 LLM 推理

LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories

Liwei Kang, Yee Whye Teh, Wee Sun Lee

大型语言模型 (LLMs) 通常通过生成探索和修改部分解决方案的中间轨迹来解决推理问题。从搜索...

arXiv:2605.31581 2026-06-02 cs.AI

选择镜头: 在上下文相关论证中激活战略视角

Choosing the Lens: Strategic Perspective Activation in Context-Dependent Argumentation

Albert Sadowski, Jarosław A. Chudziak

相同的论点常常需要在不同的外部制度下进行评估。对政权有影响力的特工拥有战略杠杆,可以...

arXiv:2605.30284 2026-06-01 cs.AI

ProjectionBench: 评估渐进式信息披露下法学硕士的科学假设生成

ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure

A. J. Lew (1), Y. Cao (1), M. J. Buehler (1) ((1) Unreasonable Labs)

科学发现本质上是一个创造性和不确定性的过程,,需要超出已知知识回忆的推理。虽然许多基准...

arXiv:2605.30288 2026-06-01 cs.AI

MIRA: 用于源感知数据选择的中期训练评分标准锚定

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai

中期培训已成为现代 LLM 发展, 的一个重要阶段,在最终的后期培训之前,使用大规模策划的混合物来增强能力。

arXiv:2605.30334 2026-06-01 cs.AIcs.CL

揭秘数据组织以加强法学硕士培训

Demystifying Data Organization for Enhanced LLM Training

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

大型语言模型 (LLMs) 已经彻底改变了各个领域,,但它们的训练效率在很大程度上依赖于有效的数据管理。虽然达...

arXiv:2605.30335 2026-06-01 cs.AIcs.CL

局部连贯, 全局不连贯: 多组件 LLM 代理中的边界构成不连贯

Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents

Anany Kotawala

多组件 LLM 代理从组件中组装概率声明,每个组件仅看到联合问题的一部分; 该组合可能违反基本...

arXiv:2605.30344 2026-05-31 cs.AI

微小但值得信赖的: 用于时间序列异常检测的高效视觉语言推理

Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection

Xiaona Zhou, Muntasir Wahed, Tianjiao Yu, Constantin Brif, Ismini Lourentzou

视觉语言模型 (VLMs) 的最新进展在许多任务中取得了令人印象深刻的性能,,但之前的研究报告表现不令人满意...

arXiv:2605.30345 2026-05-31 cs.AIcs.CLcs.LG

使用基于语义的代码表示形式生成 SchGen: PCB 原理图

SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations

Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu

印刷电路板 (PCB) 原理图设计定义了几乎所有电子硬件,,但它仍然需要大量手动和专业知识。虽然生成A...

arXiv:2605.30353 2026-05-30 cs.AIastro-ph.COcs.HCcs.SE

物理就是您所需要的? 物理学家监督的科学软件人工智能开发案例研究

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

Nhat-Minh Nguyen

AI 代理是工具, 合著者, 还是研究人员? 我们提出了量化案例研究($N=1$): 监督 AI 编码代理的物理学家(Claude Code, ...

arXiv:2605.28763 2026-05-29 cs.AI

CubePart: 开放词汇的零件可控 3D 生成器

CubePart: An Open-Vocabulary Part-Controllable 3D Generator

Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

游戏和模拟中使用的交互式 3D 资源通常被分解为特定的语义部分,以支持动画, 物理, 和脚本化 b...

arXiv:2605.28764 2026-05-29 cs.AIcs.DCcs.MA

SwarmHarness: 通过去中心化激励协调 AI 代理网络进行基于技能的任务路由

SwarmHarness: Skill-Based Task Routing via Decentralized Incentive-Aligned AI Agent Networks

Edwin Jose

个人工作站上的大量计算 (GPU 周期, 闲置推理服务器, 和作业之间的边缘设备) 未使用,因为没有激励...

arXiv:2605.28792 2026-05-29 cs.AIcs.HCcs.LG

CaMBRAIN: 实时, 使用因果状态空间模型进行连续 EEG 推理

CaMBRAIN: Real-time, Continuous EEG Inference with Causal State Space Models

Abhilash Durgam, Nyle Siddiqui, Jeffrey A. Chan-Santiago, Qiushi Fu, Elakkat D. Gireesh, Mubarak Shah

脑电图(EEG) 是监测脑电活动的关键, 非侵入性方法。脑电图的跨度可以从几秒钟到......

arXiv:2605.28807 2026-05-29 cs.AI

调整保守主义以实现可扩展的监督

Calibrating Conservatism for Scalable Oversight

William Overman, Mohsen Bayati

能够自主规划和扩展环境交互的代理人工智能系统提出了一个基本的控制问题:人类如何维持...

arXiv:2605.27361 2026-05-28 cs.AIeess.SY

检索代理配置的自然语言查询

Natural Language Query to Configuration for Retrieval Agents

Melissa Z. Pan, Negar Arabzadeh, Mathew Jacob, Fiodar Kazhamiaka, Esha Choukse, Matei Zaharia

现代检索代理公开了许多配置选择 - LLM, 检索器, 文档数, 跳数, 和合成策略 - 每个形状...

arXiv:2605.27366 2026-05-28 cs.AIcs.CLcs.LGcs.MA

MUSE-Autoskill: 通过技能创建, 内存, 管理, 和评估实现自我进化代理

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang

大型语言模型 (LLM) 代理依靠可重用技能来解决复杂任务,,但现有的技能创建方法通常将技能视为孤立的......

arXiv:2605.26086 2026-05-27 cs.AI

Claw-Anything: 对始终在线的个人助理进行基准测试,可更广泛地访问用户的数字世界

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu

大型语言模型代理越来越多地被设想为永远在线的个人助理,可以访问用户 27 年代数字世界中的任何相关内容......

arXiv:2605.26112 2026-05-27 cs.AIcs.LG

从模型扩展到系统扩展: 扩展代理 AI 中的工具

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

Shangding Gu

本文研究了代理 AI 的下一个主要瓶颈,因为系统扩展, 不仅是模型扩展:,还有可审计, 持久, 模块化, 的设计以及...

arXiv:2605.26114 2026-05-27 cs.AIcs.CL

MobileGym: 用于移动 GUI 代理研究的可验证且高度并行的仿真平台

MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li, Bojiang Zhou, Zheng Ju, Zichen Liu, Lue Fan, Zhaoxiang Zhang

我们推出 MobileGym, 一个浏览器托管的, 轻量级, 完全可控的环境,适合日常移动使用, 目标是交互保真度,无需重新...

arXiv:2605.23899 2026-05-26 cs.AI

从原始经验到技能消耗: 模型生成代理技能的系统研究

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo

语言代理通过重用\emph{skills}(从过去的经验中提取的结构化程序工件)不断改进。特别是, \emph{...

arXiv:2605.23904 2026-05-26 cs.AIcs.CL

SkillOpt: 自我发展座席技能的执行策略

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

Yifan Yang, Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou, Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo

如今的代理技能是手工制作的, 一次性生成的, 或通过松散控制的自我修订, 演变而来的,,其中没有一个表现得像深度学习...

arXiv:2605.22733 2026-05-25 cs.AIcs.SE

HarnessAPI: 统一流 API 和 MCP 工具的技能优先框架

HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools

Edwin Jose

如今,部署为 LLM 工具的每个 Python 函数都必须以两种形式存在: 用于面向人类的客户端和 CI 管道的 HTTP 端点, 和一个 MCP...

arXiv:2605.22759 2026-05-25 cs.AI

迈向可穿戴健康数据的通用智能和接口

Towards a General Intelligence and Interface for Wearable Health Data

Girish Narayanswamy, Maxwell A. Xu, A. Ali Heydari, Samy Abdel-Ghaffar, Marius Guerard, Kara Vaillancourt, Zhihan Zhang, Jake Garrison, Levi Albuquerque, Dimitris Spathis, Hong Yu, Hamid Palangi, Xuhai "Orson" Xu, David G.T. Barrett, Joseph Breda, Jed McGiffin, Yubin Kim, Yuwei Zhang, Naghmeh Rezaei, Samuel Solomon, Karan Ahuja, Tim Althoff, Jake Sunshine, Ming-Zher Poh, Benjamin Yetton, Ari Winbush, Nicholas B. Allen, James M. Rehg, Isaac Galatzer-Levy, Yun Liu, John Hernandez, Anupam Pathak, Conor Heneghan, Yuzhe Yang, Ahmed A. Metwally, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Xin Liu, Daniel McDuff

虽然无处不在的可穿戴传感器捕获了大量的行为和生理信息,,但有效地将这些信号转化为个性化...

arXiv:2605.22763 2026-05-25 cs.AI

通过人工智能驱动的形式证明搜索推进数学研究

Advancing Mathematics Research with AI-Driven Formal Proof Search

George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferraiuolo, Henryk Michalewski, Edward Lockhart, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri

大型语言模型 (LLMs) 越来越擅长数学推理,,但它们的不可靠性限制了它们在数学研究中的实用性。一个米特...

arXiv:2605.22773 2026-05-25 cs.AImath.OC

通过深度强化学习实现随机作业到达的灵活作业车间调度

Deep Reinforcement Learning for Flexible Job Shop Scheduling with Random Job Arrivals

Yu Tang, Muhammad Zakwan, Efe Balta, John Lygeros, Alisa Rupenyan

灵活作业车间调度问题 (FJSP) 是一组作业到机器的最佳分配。 FJSP: 联合国仍然存在两个主要挑战...

arXiv:2605.22786 2026-05-24 cs.AIcs.ETcs.LGcs.MA

LCGuard: 潜在通信防护,用于多代理系统中的安全 KV 共享

LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems

Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy

基于大型语言模型 (LLM) 的多代理系统越来越依赖中间通信来协调复杂的任务。虽然大多数现有...

arXiv:2605.22791 2026-05-24 cs.AI

门控 DeltaNet-2: 解耦线性注意力擦除和写入

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Ali Hatamizadeh, Yejin Choi, Jan Kautz

线性注意力用固定大小的循环状态,取代了softmax注意力的无界缓存,将序列混合减少到线性时间和解码...

arXiv:2605.22794 2026-05-23 cs.AIcs.LG

MOSS: 通过自主代理系统中的源代码级重写进行自我进化

MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems

Qianshu Cai, Yonggang Zhang, Xianzhang Jia, Huajiang Zheng, Wei Xue, Jun Song, Xinmei Tian, Yike Guo

自主代理系统在部署后基本上是静态的:,它们不会从用户交互中学习,,并且反复出现的故障持续存在,直到下一个......

arXiv:2605.21427 2026-05-22 cs.AIcs.DC

PALS: Power-Aware LLM 服务于混合专家模型

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

Can Hankendi, Rana Shahout, Minlan Yu, Ayse K. Coskun

大型语言模型 (LLM) 推理已成为现代数据中心的主要工作负载, 显着推动 GPU 利用率和能耗...

arXiv:2605.21458 2026-05-22 cs.AIcs.LGstat.ME

注意模拟与真实的差距 & 像科学家一样思考

Mind the Sim-to-Real Gap & Think Like a Scientist

Harsh Parikh, Gabriel Levin-Konigsberg, Dominique Perrault-Joncas, Alexander Volfovsky

假设规划者有一个针对顺序决策问题的预训练模拟器,并且可以选择在现场运行真实实验。该模拟器是...

arXiv:2605.21481 2026-05-22 cs.AIcs.CLcs.LG

AiraXiv: 面向人类和人工智能科学家的人工智能驱动的开放访问平台

AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists

Junshu Pan, Panzhong Lu, Yixuan Weng, Qiyao Sun, Fang Guo, Zijie Yang, Qiji Zhou, Yue Zhang

人工智能 (AI) 的最新进展加速了人类创作和人工智能生成的研究成果的增长, 增加了...

arXiv:2605.21482 2026-05-22 cs.AI

DeepWeb-Bench: 需要大量跨源证据和长期推导的深度研究基准

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma

深入研究,,其中代理搜索开放网络, 收集证据, 并通过扩展推理得出答案, 是一个突出的用例...

arXiv:2605.20173 2026-05-21 cs.AIcs.SE

为生产 LLM 代理选择和组合运行时架构模式的方法

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

Vasundra Srinivasan

生产 LLM 代理将随机模型输出与确定性软件系统, 相结合,但两者之间的边界很少被视为一个界限...

arXiv:2605.16215 2026-05-19 cs.AIcs.CL

完全开放 Meditron: 临床法学硕士的可审核管道

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

临床决策支持系统 (CDSS) 需要可仔细的, 可审计管道,以实现严格的, 可重复验证。然而目前基于法学硕士的 C...

arXiv:2605.16233 2026-05-19 cs.AIcs.CLcs.LGcs.MAeess.SY

FORGE: 自我进化代理内存,无需通过群体广播进行权重更新

FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast

Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman

LLM 代理能否通过自生成内存而无需梯度更新来改进决策? 我们建议 FORGE (Failure-Optimized Reflective Graduati...

arXiv:2605.16238 2026-05-19 cs.AI

使用自主法学硕士引导的树搜索进行前瞻性多病原体疾病预测

Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search

Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi

传染病的概率预测对于公共卫生至关重要,但依赖于专家建模的劳动密集型手动模型管理...

arXiv:2605.15015 2026-05-18 cs.AIcs.CLcs.HC

Small, 私有语言模型作为教育评估设计的队友

Small, Private Language Models as Teammates for Educational Assessment Design

Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou

生成式人工智能越来越多地支持教育设计任务,,例如,通过大型语言模型(LLMs),展示了设计评估的能力...

arXiv:2605.15040 2026-05-18 cs.AIcs.CL

Orchard: 开源代理建模框架

Orchard: An Open-Source Agentic Modeling Framework

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

代理建模旨在将 LLM 转变为能够通过规划, 推理, 工具使用, 和多回合解决复杂任务的自主代理...

arXiv:2605.15041 2026-05-17 cs.AIcs.CL

LLM 工具使用的自适应推理和执行的基于案例的校准

Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang

工具的使用将大型语言模型扩展到参数知识之外,,但可靠的执行需要平衡适当的推理深度与严格的......

arXiv:2605.15100 2026-05-17 cs.AI

二维一致性: 在自适应推理时间缩放中平衡预算和质量

Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling

Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan

大型语言模型 (LLMs) 表现出了卓越的推理能力。然而, 通过推理时间缩放来最大限度地发挥其潜力...

arXiv:2605.15109 2026-05-17 cs.AIcs.IR

为什么邻域很重要: Agentic GraphRAG 中的遍历上下文和来源

Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz

检索增强生成可以通过将答案扎根于外部证据, 来提高事实性,但 Agentic GraphRAG 使其对公民的意义变得复杂化......

arXiv:2605.15132 2026-05-17 cs.AIcs.DCcs.MA

APWA: 用于可并行代理工作流的分布式架构

APWA: A Distributed Architecture for Parallelizable Agentic Workflows

Evan Rose, Tushin Mallick, Matthew D. Laws, Cristina Nita-Rotaru, Alina Oprea

基于大型语言模型 (LLMs) 的自主多智能体系统在独立解决复杂任务方面表现出了卓越的能力......

arXiv:2605.15177 2026-05-16 cs.AI

OpenDeepThink: 通过 Bradley-Terry 聚合进行并行推理

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

测试时计算扩展是改进 LLM 推理的主轴。现有的方法主要通过扩展单个推理轨迹来扩展深度......

arXiv:2605.13821 2026-05-15 cs.AIcs.LG

利用代理进化

Harnessing Agentic Evolution

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

代理进化已成为通过迭代生成候选,来改进程序,工作流程,和科学解决方案的强大范例。

arXiv:2605.13825 2026-05-15 cs.AIcs.CV

历史锚: 先前的行为如何引导法学硕士做出不安全行为的决定

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

Alberto G. Rodríguez Salgado

前沿法学硕士越来越多地被部署为代理,在由相同或不同的管理人员生成的大量先前工具调用日志后选择下一步操作。

arXiv:2605.13830 2026-05-15 cs.AIcs.LG

量化树集成的敏感性: 符号和组合方法

Quantifying Sensitivity for Tree Ensembles: A symbolic and compositional approach

Ajinkya Naik, Chaitanya Garg, S. Akshay, Ashutosh Gupta, Kuldeep S. Meel

决策树集成 (DTE) 是广泛的 AI 分类任务的流行模型, 用于多个安全关键领域,,因此非常...

arXiv:2605.12474 2026-05-14 cs.AI

基于评分标准的强化学习中的奖励黑客

Reward Hacking in Rubric-Based Reinforcement Learning

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He

具有可验证奖励的强化学习在数学和编码等领域实现了强大的训练后收益,,尽管许多开放式设置...

arXiv:2605.12481 2026-05-14 cs.AI

ToolCUA: 为计算机使用代理实现最佳 GUI 工具路径编排

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye

计算机使用代理 (CUAs) 可以通过原子 GUI 操作,(例如单击和键入,)和高级工具调用,(例如基于 API 的文件操作)进行操作...

arXiv:2605.08013 2026-05-12 cs.AI

在选择性观察下学习具有结构化行动信用的 CLI 代理

Learning CLI Agents with Structured Action Credit under Selective Observation

Haoyang Su, Ying Wen

命令行界面 (CLI) 代理正在成为代理与计算机交互的实用范例,通过不断发展的文件系统, 可执行命令...

arXiv:2605.08019 2026-05-12 cs.AIq-bio.NC

玩: 前沿 LRM 和人类游戏学习者之间的行为和大脑一致性的原因

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

人类在遇到新环境时快速学习抽象知识,并灵活运用这些知识来指导高效、智能的行为……

arXiv:2605.08024 2026-05-12 cs.AI

MPD$^2$-Router: 青光眼筛查和诊断中的掩模感知多专家先验正则化双头延迟路由器

MPD$^2$-Router: Mask-aware Multi-expert Prior-regularized Dual-head Deferral Router in Glaucoma Screening and Diagnosis

Wenxin Zhan

学习推迟 (L2D) 可以通过将困难的/uncertain病例转交给人类,,使青光眼筛查更安全,但标准公式忽略了专家的意见...

arXiv:2605.08061 2026-05-12 cs.AI

基于评分标准的 RL: 针对可推广推理的结构化法官奖励

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

我们认为,将奖励分解为加权,可验证标准并使用LLM法官对其进行评分提供了部分学分优化信号......

arXiv:2605.08070 2026-05-12 cs.AI

VecCISC: 通过推理跟踪聚类和候选答案选择提高置信度知情的自我一致性

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

扩展推理时间推理的标准技术是自我一致性,,其中多个候选答案是从法学硕士中抽取的,并且最...

arXiv:2605.06530 2026-05-11 cs.AI

SpatialEpiBench: 预测中的空间信息和流行病先验基准

SpatialEpiBench: Benchmarking Spatial Information and Epidemic Priors in Forecasting

Ruiqi Lyu, Alistair Turcan, Bryan Wilder

准确的流行病预测对于公共卫生应对,资源分配,和疫情干预,至关重要,但由于资源稀少,仍然很困难...

arXiv:2605.06540 2026-05-11 cs.AIcs.GT

人工智能引发的创意多样性崩溃的事前评估

Ex Ante Evaluation of AI-Induced Idea Diversity Collapse

Nafis Saami Azad, Raiyan Abdul Baten

创造性的人工智能系统通常在个人效用,的水平上进行评估,但创造性的产出却被群体所消耗:,一个想法就会失去价值......

arXiv:2605.06583 2026-05-10 cs.AI

通过伴随匹配:确定性控制管道来微调流量模型的改进技术

Improved techniques for fine-tuning flow models via adjoint matching: a deterministic control pipeline

Zhengyi Guo, Jiayuan Sheng, David D. Yao, Wenpin Tang

我们提出了一个确定性伴随匹配框架,该框架为基于流的生成模型制定人类偏好对齐作为最佳控制...

arXiv:2605.06584 2026-05-10 cs.AI

NeuroAgent: 用于多模式神经影像分析和研究的法学硕士代理

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

多模态神经影像分析通常涉及复杂的, 模态特定预处理工作流程,需要仔细配置, 质量控制...

arXiv:2605.06614 2026-05-10 cs.AIcs.CL

SkillOS: 自我进化代理的学习技能管理

SkillOS: Learning Skill Curation for Self-Evolving Agents

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

基于 LLM 的代理越来越多地被部署来处理流任务,,但它们通常仍然是一次性的问题解决者,无法从过去的经验中学习……

arXiv:2605.06623 2026-05-10 cs.AIcs.CLcs.LGcs.MA

MASPO: 基于 LLM 的多代理系统的联合提示优化

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

基于大型语言模型 (LLM) 的多代理系统 (MAS) 在处理复杂的协作任务, 方面表现出了希望,其中代理通常是...

arXiv:2605.06638 2026-05-10 cs.AIcs.CL

强化学习能否向法学硕士教授长期推理? 表达能力是关键

Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

Tianle Wang, Zhaoyang Wang, Guangchen Lan, Xinpeng Wei, Sipeng Zhang, Guanwen Qiu, Abulhair Saparov

强化学习(RL)已被应用于改进大型语言模型(LLM)推理,,但对训练如何随任务扩展的系统研究...

arXiv:2605.06641 2026-05-09 cs.AIcs.CV

GlazyBench: 陶瓷釉料性能预测和图像生成的基准

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

由于复杂的化学成分,开发陶瓷釉料是一个成本高昂的,、耗时的反复试验过程,,给独立的……带来了沉重的负担。

arXiv:2605.06651 2026-05-09 cs.AI

AI 联合数学家: 通过代理 AI 加速数学家发展

AI co-mathematician: Accelerating mathematicians with agentic AI

Daniel Zheng, Ingrid von Glehn, Yori Zwols, Iuliya Beloshapka, Lars Buesing, Daniel M. Roy, Martin Wattenberg, Bogdan Georgiev, Tatiana Schmidt, Andrew Cowie, Fernanda Viegas, Dimitri Kanevsky, Vineet Kahlon, Hartmut Maennel, Sophia Alj, George Holland, Alex Davies, Pushmeet Kohli

我们推出了 AI 联合数学家,,这是数学家可以交互地利用 AI 代理进行开放式研究的工作台。人工智能数学...

arXiv:2605.05007 2026-05-08 cs.AI

Uno-Orchestra: 通过选择性委派进行简约代理路由

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

大型语言模型 (LLM) 多代理系统通常依赖于严格的编排, 致力于平坦的每个查询路由或手工设计...

arXiv:2605.05017 2026-05-08 cs.AIcs.RO

立场: 嵌入式人工智能需要隐私与实用性之间的权衡

Position: Embodied AI Requires a Privacy-Utility Trade-off

Xiaoliang Fan, Jiarui Chen, Zhuodong Liu, Ziqi Yang, Peixuan Xu, Ruimin Shen, Junhui Liu, Jianzhong Qi, Cheng Wang

嵌入式 AI (EAI) 系统正在迅速从模拟过渡到现实家庭和其他敏感环境。然而,最近的EAI所以...

arXiv:2605.05138 2026-05-08 cs.AI

编码代理时代 ARC-AGI-3 的可执行世界模型

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

Sergey Rodionov

我们评估了 ARC-AGI-3 的初始编码代理系统,其中代理维护一个可执行的 Python 世界模型, 对照之前的 o...进行验证。

arXiv:2605.05191 2026-05-08 cs.AI

LongSeeker: 用于长范围搜索代理的弹性上下文编排

LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents

Yijun Lu, Rui Ye, Yuwen Du, Jiajun Wang, Songhua Liu, Siheng Chen

长视野搜索代理必须管理快速增长的工作环境,因为它们推理,调用工具,并观察信息。天真地积累着一切……

arXiv:2605.04019 2026-05-07 cs.AIcs.CR

重新定义代理时代的 AI 红队: 从几周缩短为几小时

Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours

Raja Sekhar Rao Dheekonda, Will Pearce, Nick Landers

人工智能系统正在进入医疗保健,、金融,和国防,等关键领域,但仍然容易受到对抗性攻击。虽然人工智能红队是......

arXiv:2605.04036 2026-05-07 cs.AIcs.CL

OpenSeeker-v2: 通过信息丰富且高难度的轨迹突破搜索代理的极限

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

Yuwen Du, Rui Ye, Shuo Tang, Keduan Huang, Xinyu Zhu, Yuzhu Cai, Siheng Chen

深度搜索能力已成为前沿大型语言模型(LLM)智能体,不可或缺的能力,但其发展仍然占据主导地位...

arXiv:2605.00440 2026-05-05 cs.AIcs.CLcs.HC

人机共生中的角色感知人工智能增强和自动化

Role-Aware Artificial Intelligence Across Augmentation and Automation in Human-Machine Symbiosis

Ching-Chun Chang, Yuchen Guo, Hanrui Wang, Timo Spinde, Isao Echizen

人工智能(AI)的进化使得人类和计算机器之间的界限变得越来越模糊。在项目中...

arXiv:2605.00572 2026-05-05 cs.AImath.OC

电动电容车辆路径问题双层后期验收爬坡中的实例感知参数配置

Instance-Aware Parameter Configuration in Bilevel Late Acceptance Hill Climbing for the Electric Capacitated Vehicle Routing Problem

Yinghao Qin, Xinwei Wang, Mosab Bazargani, Jun Chen

组合优化中的算法性能对参数设置高度敏感,,而单个全局调整的配置经常失败......

arXiv:2605.00642 2026-05-05 cs.AIcs.CV

了解从哪里点击自己: 符合政策的自我蒸馏以实现 GUI 基础

Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding

Yan Zhang, Daiqing Wu, Huawen Shen, Can Ma, Yu Zhou

图形用户界面(GUI)基础将自然语言指令映射到目标元素的视觉坐标,并作为核心功能...

arXiv:2605.00737 2026-05-05 cs.AI

调用或不调用:评估和优化LLM工具调用的框架

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

代理人工智能架构通过外部工具, 增强了法学硕士,释放了强大的功能,但可能会产生大量成本。而且,工具还...

arXiv:2605.00742 2026-05-05 cs.AIcs.LGstat.ML

立场%3代理人工智能编排应该是贝叶斯一致的

Position: agentic AI orchestration should be Bayes-consistent

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

法学硕士擅长预测任务和复杂推理任务,,但许多高价值部署依赖于不确定性, 下的决策,例如, 哪些...

arXiv:2604.28093 2026-05-04 cs.AI

是什么造就了一个好的终端代理基准任务: 对抗性指南, 困难, 和清晰的评估设计

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

Ivan Bercovich

终端代理基准测试已成为衡量大型语言模型的编码和系统管理能力的主要信号。作为...

arXiv:2604.28098 2026-05-04 cs.AIcs.CLcs.CY

绘制人工智能时代课堂互动研究的方法空间: 规模, 持续时间, 和模式

Mapping the Methodological Space of Classroom Interaction Research: Scale, Duration, and Modality in an Age of AI

Dorottya Demszky, Edith Bouton, Alison Twiner, Sara Hennessy, Richard Correnti

课堂互动的研究长期以来分为大规模观察和深入的民族志工作。我们提出了一个框架映射...

arXiv:2604.28112 2026-05-03 cs.AIcs.LO

分裂论证框架与集体攻击和支持

Splitting Argumentation Frameworks with Collective Attacks and Supports

Matti Berthold, Lydia Blümel, Giovanni Buraglio, Anna Rapberger

这项工作提出了论证形式主义的新颖分裂技术,其中结合了可废止元素之间的支持。我们的研究基础...

arXiv:2604.28125 2026-05-03 cs.AIcs.CYcs.HC

规范性与生产力: Ableist Intelligence? 聋人人工智能手语翻译工具的去增长分析

Normativity and Productivism: Ableist Intelligence? A Degrowth Analysis of AI Sign Language Translation Tools for Deaf People

Nina Seron-Abouelfadil, Poppy Fynes

任何地理或口音变化的手语, 可以理解的是,在口头命令的普遍流行下,手语, 面临着持续的审查...

arXiv:2604.28158 2026-05-03 cs.AI

Intern-Atlas: 作为人工智能科学家研究基础设施的方法论演化图

Intern-Atlas: A Methodological Evolution Graph as Research Infrastructure for AI Scientists

Yujun Wu, Dongxu Zhang, Xinchen Li, Jinhang Xu, Yiling Duan, Yumou Liu, Jiabao Pan, Qiyuan Zhu, Xuanhe Zhou, Jingxuan Wei, Siyuan Li, Jintao Chen, Conghui He, Cheng Tan

现有的研究基础设施基本上是以文档为中心的,提供论文之间的引用链接,但缺乏对我的明确表示......

arXiv:2604.28178 2026-05-03 cs.AI

法学硕士作为临床图结构细化器: 增强脑电图癫痫发作诊断中的表征学习

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

Lincan Li, Zheng Chen, Yushun Dong

脑电图(EEG) 信号对于自动癫痫检测, 至关重要,但其固有的噪声使稳健的表示学习面临挑战......

arXiv:2604.28181 2026-05-03 cs.AIcs.CLcs.LG

用于长期生产力模拟的大规模合成计算机

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

现实的长期生产力工作很大程度上取决于用户特定的计算机环境,,其中存储了大部分工作上下文并......

arXiv:2604.26805 2026-05-01 cs.AIcs.MA

扁鹊: 在线系统操作技能安排灵活的代理框架

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

运营和维护(O&M)大型在线引擎系统(eg,搜索,推荐和广告)需要大量人力来重新...

arXiv:2604.24686 2026-04-29 cs.AI

治理您无法观察到的内容: 自主 AI 代理的自适应运行时治理

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

German Marin, Jatin Chaudhary

自主人工智能代理可以保持完全授权,但随着行为漂移,对手适应,并且决策模式在没有...的情况下发生变化,仍然变得不安全。

arXiv:2604.24697 2026-04-29 cs.AI

当前代理能否缩小发现到应用程序的差距? Minecraft 中的案例研究

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

发现因果规律并将其应用于构建功能系统(发现到应用循环)是通用智能的标志...

arXiv:2604.24710 2026-04-29 cs.AIcs.CL

临床 AI 评估的具体案例评估: 方法, 验证, 和法学硕士-临床医生在 823 次接触中达成的协议

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

客观的。临床 AI 文档系统需要临床有效, 经济可行, 且对迭代敏感的评估方法...

arXiv:2604.24717 2026-04-29 cs.AI

学习旋转: 时间和语义旋转编码以进行顺序建模

Learning to Rotate: Temporal and Semantic Rotary Encoding for Sequential Modeling

Hailing Cheng, Daqi Sun, Xinyu Lu

每个 Transformer 架构都致力于学习语义嵌入空间中丰富的表示的巨大能力 - 然而旋转流形...

arXiv:2604.21965 2026-04-28 cs.AI

阅读论文, 编写代码: 社会科学结果的代理再现

Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results

Benjamin Kohler, David Zollikofer, Johanna Einsiedler, Alexander Hoyle, Elliott Ash

最近的工作使用 LLM 代理来重现实证社会科学结果,并可访问数据和代码。我们通过询问: 来扩大这个范围...

arXiv:2604.22026 2026-04-28 cs.AIcs.CYcs.DL

重新思考 Publication: AI 支持研究的认证框架

Rethinking Publication: A Certification Framework for AI-Enabled Research

Yang Lu, Rabimba Karanjai, Lei Xu, Weidong Shi

人工智能研究渠道现在可以产生可以满足现有同行评审质量,新颖性,和方法严谨性标准的学术工作。哈...

arXiv:2604.22080 2026-04-28 cs.AI

健全的代理科学需要对抗性实验

Sound Agentic Science Requires Adversarial Experiments

Dionizije Fa, Marko Culjak

基于 LLM 的代理正在迅速被用于科学数据分析, 自动化任务,这些任务曾经受到人力时间和专业知识的限制。这个能力是...

arXiv:2604.22085 2026-04-27 cs.AI

Memanto: 类型化语义记忆与长视野智能体的信息理论检索

Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents

Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel, Neel Patel, Majid Fekri, Tara Khani

从无状态语言模型推理到持久, 多会话自治代理的转变表明内存是主要架构...

arXiv:2604.22119 2026-04-27 cs.AI

AI: 中的新兴战略推理风险:分类驱动的评估框架

Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework

Tharindu Kumarage, Lisa Bauer, Yao Ma, Dan Rosen, Yashasvi Raghavendra Guduri, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris

随着推理能力和部署范围同步增长, 大型语言模型 (LLM) 获得了参与服务于自己的行为的能力......

arXiv:2604.22273 2026-04-27 cs.AI

作为反馈控制的自我校正: 误差动态, 稳定性阈值, 和法学硕士中的及时干预

Self-Correction as Feedback Control: Error Dynamics, Stability Thresholds, and Prompt Interventions in LLMs

Aofan Liu, Jingxiang Meng

迭代式自我修正越来越多地部署在代理 LLM 系统, 中,但重复细化是否会提高或降低性能仍然是一个问题。

arXiv:2604.22411 2026-04-27 cs.AIcs.CLcs.LG

引入背景温度来表征大型语言模型中的隐藏随机性

Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models

Alberto Messina, Stefano Scotta

即使使用温度 $T=0$, 大型语言模型 (LLMs) 进行解码,也可以为相同的输入产生不同的输出。 Thinking Ma 的最新作品...

arXiv:2604.22428 2026-04-27 cs.AI

CognitiveTwin: 稳健的多模态数字双胞胎,用于预测阿尔茨海默的 疾病的认知衰退

CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

由于疾病进展的异质性,预测阿尔茨海默的疾病(AD)的个体认知能力下降很困难。可靠的临床...

arXiv:2604.22436 2026-04-27 cs.AIcs.IRcs.MA

AgentSearchBench: AI 代理野外搜索基准

AgentSearchBench: A Benchmark for AI Agent Search in the Wild

Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz

AI 代理生态系统的快速发展正在改变复杂任务的委派和执行方式,,这为识别合适的任务带来了新的挑战……

arXiv:2604.22446 2026-04-27 cs.AI

从技能到人才: 将异构代理组织为现实世界的公司

From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company

Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin Luo, Jun Wang

通过模块化技能和工具集成,单个代理的能力迅速提高,,但多代理系统仍然受到固定...

arXiv:2604.22452 2026-04-27 cs.AIcs.CLcs.LG

Superminds Test: 通过探测特工积极评估特工社会的集体智慧

Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

Xirui Li, Ming Li, Yunze Xiao, Ryan Wong, Dianqi Li, Timothy Baldwin, Tianyi Zhou

集体智慧是指一个群体取得超出任何单个成员单独所能完成的成果的能力。作为大语言...

arXiv:2604.22455 2026-04-27 cs.AI

ABPMS 流程框架的混合性质及其对自动化流程发现的影响

On the Hybrid Nature of ABPMS Process Frames and its Implications on Automated Process Discovery

Anti Alman, Izack Cohen, Avigdor Gal, Fabrizio Maria Maggi, Marco Montali

任何 AI 增强业务流程管理系统 (ABPMS) 的核心组件是流程框架,,它为系统提供流程意识和定义...

arXiv:2604.22577 2026-04-27 cs.AIcs.CL

QuantClaw: 精度对于 OpenClaw 至关重要

QuantClaw: Precision Where It Matters for OpenClaw

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Xiaohao Liu, Zhenhua Dong, Xianzhi Yu, Haoli Bai, Xiaobo Xia

由于长上下文输入和多轮推理,OpenClaw 等自主代理系统带来了巨大的效率挑战。这个结果...

arXiv:2604.22597 2026-04-27 cs.AI

重新思考数学推理评估: 超越符号僵化的稳健法学硕士法官框架

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

大型语言模型的最新进展导致了各种任务, 的显着改进,包括数学推理,,它使用...

arXiv:2604.22748 2026-04-27 cs.AI

代理世界建模: 基础, 能力, 法则, 及其他

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

随着人工智能系统从生成文本转向通过持续交互完成目标,,对环境动态进行建模的能力成为一个中心......