arXiv:2609.09056
2026-09-10
cs.AIcs.MAeess.SYmath.CT
Time-Varying Data as Sheaves: an Invitation to Narratives
Wilmer Leal, Benjamin Merlin Bumpus, Jana K. Nickel, Johan García, James Fairbanks, Warren Dixon
现代科学和工程越来越依赖于时变数据,,但用于模拟时间现象的数学工具经常被开发出来......
arXiv:2609.09081
2026-09-10
cs.AI
Everything in Moderation: Per-Domain Coverage Optima and Alignment-Resistant Domain Gaps in Multi-Domain Mid-Training
Yunpeng Xu, Kun Zheng
训练中期, 预训练和对齐, 之间的阶段是模型的 每个域数据组合通常由数据可用性设置的阶段,而不是...
arXiv:2609.09094
2026-09-10
cs.AI
The Surprising Effectiveness of Approximate Value Iteration in Self-Play
Raphael Boige, Amine Boumaza, Bruno Scherrer
将搜索与函数逼近相结合推动了游戏程序的重大进步, 使自玩算法比以往更具竞争力......
arXiv:2609.09113
2026-09-09
cs.AIcs.CLcs.LG
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu
虽然递归自我改进(RSI)的研究主要采用自动化模型训练管道,,但可靠的自主开发需要错误的...
arXiv:2609.09115
2026-09-09
cs.AIcs.SE
MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents
Boyu Yang, Jiazheng Sun, Zilong Lu, Zhi Qiu, Xin Peng, Jun Zheng
长期大型语言模型 (LLM) 代理依靠外部存储系统来跨扩展交互保留用户偏好和任务知识...
arXiv:2609.09126
2026-09-09
cs.AIcs.LGstat.ML
A Generalization of Amari's Bayesian Duality
Mohammad Emtiyaz Khan, Thomas Möllenhoff
Amari 对信息几何和机器学习的贡献是众所周知的。在这里,我们重新审视Amari的关于贝叶斯对偶性的工作,该工作尚未记录...
arXiv:2609.09133
2026-09-09
cs.AIcs.CLcs.SE
ExecCritic: Learn to Test, Test to Improve for Coding Agents
Leitian Tao, Baolin Peng, Haorui Wang, Hang Wang, Hao Cheng, Wenlin Yao, Qianhui Wu, Tao Ge, Sharon Li, Jianfeng Gao
执行反馈可以指导编码代理进行正确的存储库修复,,但前提是测试捕获了问题所请求的行为。年龄...
arXiv:2609.09134
2026-09-09
cs.AI
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur
代理利用(系统提示,工具集,执行挂钩,和围绕模型的上下文管理支架)是代理的关键决定因素...
arXiv:2609.09137
2026-09-09
cs.AIcs.CL
A Data-Driven Framework for Identifying and Prioritizing RPA Opportunities in Healthcare Processes
Maria Alejandra Gomez, Juan Manuel Castillo
机器人流程自动化 (RPA) 被广泛用于减轻美国医院的行政负担,,但估计有 30-50% 的 RPA 计划...
arXiv:2609.09153
2026-09-09
cs.AIcs.CLcs.MA
Procedural Graphs: Self-Evolving Execution Structures for LLM Agents
Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık
大型语言模型越来越多地被部署为能够进行长期规划并通过外部工具执行操作的代理。大多数代理选择行动通过...
arXiv:2609.05275
2026-09-09
cs.AI
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
Mostafa Elhoushi, Alex Pretko, Nolan Dey, Bin Claire Zhang, Gavia Gray, Gurpreet Gosal, Abdulrahman Mahmoud, Shane Bergsma, Joel Hestness
Layer dropout (a.k.a.随机深度) 已被证明可以实现更快的训练, 更高的准确性, 以及对零样本层剪枝的鲁棒性...
arXiv:2609.05279
2026-09-09
cs.AIcs.MA
Testing Interchangeability in LLM Agent Teams
Jianxin Gao, Tianyi Yu, Linna Deng, Runze Li, Zining Wang
Production multi-agent systems replace agents constantly, on the assumption that an agent filling a role is interchangeable with any other agent that ...
arXiv:2609.05284
2026-09-08
cs.AI
GUT: Quantifying and Optimizing the Reasoning Uncertainty of LLMs via Graph Complexity
Shuang Liang, Xin-Yu Hu, Xiang-Jun Ou, Shao-Qun Zhang
近年来,大型语言模型(LLMs) 的推理能力取得了巨大进步。然而, LLM的推理过程通常...
arXiv:2609.05289
2026-09-08
cs.AI
Beyond Aggregate Scores: Behavioral Correctness Assumptions for Assessing Reference-Based Automatic Evaluation Methods
Maria Mahbub, Ashley Rice, Michael R. Munroe, Amidu Kamara, Amir Sadovnik
基于参考的自动评估方法在评估自然语言生成系统中发挥着至关重要的作用。现有的元评估主要...
arXiv:2609.05295
2026-09-08
cs.AI
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
Yang Li, Semih Yavuz, Shafiq Joty
在策略蒸馏(OPD) 为语言模型训练后, 提供密集的, 每个标记监督,但其有效性受到教师的瓶颈......
arXiv:2609.05314
2026-09-08
cs.AIcs.CLeess.SY
Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness
Alexander Neubauer, Tianzhen Hong, Han Li, Mengbo Yu, Amin Darbandi, Yannick Fürst, Martin Kriegel
楼宇自动化系统生成丰富的传感器数据,但仍然缺乏洞察力,因为异构点命名, 缺少元数据, 和碎片化文档...
arXiv:2609.05327
2026-09-08
cs.AIcs.AR
LLM-Driven Algorithm Design for Quantum Circuit Synthesis based on Binary Decision Diagrams
Yoonju Sim, Federico Berto, Chuanbo Hua, Jinkyoo Park, Changhyun Kwon
量子电路是在量子器件, 上实现量子算法的核心,其中量子门必须是可逆的。许多量子算法...
arXiv:2609.05333
2026-09-08
cs.AIcs.CL
Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models
José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez, Marcelo Vinicius de Paula, Tárcio André dos Santos Barros
Transformer 语言模型将单个 , 上下文无关向量分配给其嵌入层 , 的单词类型,但人们普遍认为它可以个性化......
arXiv:2609.05339
2026-09-08
cs.AIcs.CLcs.IR
Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability
Ankit Goyal, Jaideep Ray
模型升级是例行公事,而 3B 内存迁移则不然。代理可以保留相同的内存存储,但仍然会忘记:新模型可能会解释旧的注释......
arXiv:2609.05346
2026-09-08
cs.AI
Who Should Grade My Work? Student Perspectives on Transparent AI-Assisted Writing Assessment in Higher Education
Rayed AlGhamdi
GenAI 工具集成到高等教育评估中引发了关于学生如何理解,、解释, 并对 AI 做出反应的重要问题......
arXiv:2609.05374
2026-09-08
cs.AI
CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents
Haoting Shi, Wenhao Wang, Weicheng Fang, Yaozhong Liang, Tian Jin, Pengxiang Zhao, Guangyi Liu, Siheng Chen, Yanfeng Wang
计算机使用代理在 OSWorld 和 AndroidWorld, 等基准上取得了进步,但仍然主要通过 GUI, 进行操作,通常会产生低效的轨迹...
arXiv:2609.05381
2026-09-08
cs.AI
Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Roland C. Aydin, Christian Feiler
大型语言模型 (LLMs) 越来越多地在分子属性基准, 上进行评估,但准确性无法区分预测属性的模型...
arXiv:2609.05385
2026-09-08
cs.AI
Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence
Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri
可以在代理工作流程中运行的法学硕士决策组件通常会产生与行动相关的建议或判断以及解释......
arXiv:2609.05395
2026-09-08
cs.AIcs.CL
Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe
Dain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh, Kyuseong Lim
数据主权法规越来越要求公共机构部署开源, 本地 LLM 代理,将多个工具调用链接到...
arXiv:2609.05396
2026-09-08
cs.AI
A Deep Generative Model for Synthesizing Labeled Wireless Signals
Yuxiao Li, Keke Hu, Santiago Mazuelas, Yuan Shen
具有位置相关标签的无线信号对于无线传感领域的性能评估和模型训练至关重要。然而...
arXiv:2608.13547
2026-08-15
cs.AIcs.SE
QuoteBench: How Matched Scores Can Hide Command-Path Failures
Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
LLM 编码代理通过接口发出 Bash 命令,这些命令可以序列化, 包装, 并重新解析模型输出。仅匹配的执行分数并不能区分...
arXiv:2608.13558
2026-08-15
cs.AIcs.CL
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
基础模型的最新进展使 AI 科学家能够自动化日益完整的研究工作流程,,从假设生成到分析……
arXiv:2608.12150
2026-08-14
cs.AIcs.CL
Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
Rodrigo Guedes de Souza, Alison R. Panisson
大型语言模型的标准评估假设在推理条件下模型排名稳定。我们通过改变...来挑战这个假设。
arXiv:2608.12192
2026-08-14
cs.AIcs.LG
How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models
Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth
蛋白质结构预测的基础模型在某些目标上仍然不可靠。外部预言机可以标记并纠正这些故障,,但生物......
arXiv:2608.12249
2026-08-14
cs.AI
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS
Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon
对遗留 Fortran 进行现代化改造是一个很大的问题:,转换是单独的例行程序,,但代码库可能非常庞大,,并且跨越了大部分...
arXiv:2608.12282
2026-08-14
cs.AI
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
部署在企业环境中的代理必须跨结构化 API 和文档集合进行推理,,但现有基准评估这些功能...
arXiv:2608.12304
2026-08-14
cs.AI
Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models
Saman Marandi, Yu-Shu Hu, Mohammad Modarres
动态主逻辑(DML)通过将功能目标链接到底层结构来提供表示系统行为的分层框架...
arXiv:2608.09921
2026-08-12
cs.AI
GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis
Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler
基础模型正在改变业务工作流程并提高生产力,,但它们在电力等工程领域中仍然基本上缺席......
arXiv:2608.07457
2026-08-11
cs.AI
Interaction Creates Dynamical AI Behavior Absent in Isolation
Bella Xinrui Li, Frank Yingjie Huo, Neil F Johnson
当人工智能代理在日常生活中交互时会发生什么,当一个 AI 开始在? 左右指挥另一个 AI 时,我们找到了一个违反直觉的答案,该答案打开...
arXiv:2608.06223
2026-08-10
cs.AIcs.LG
TS-RAG: Retrieval Augmented Generation for Time Series Forecasting
Yixiong Xiao, Congxi Xiao, Jingbo Zhou
虽然深度学习模型,尤其是基于变压器的架构,在时间序列预测,应用程序中表现出了令人印象深刻的性能...
arXiv:2608.06243
2026-08-10
cs.AI
DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng
具有可验证奖励的强化学习(RLVR) 使用自动可验证输出提高大型语言模型的推理能力...
arXiv:2608.06265
2026-08-10
cs.AIcs.DBcs.LG
Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints
Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher
企业人工智能代理的综合临床基准可以通过现有的实用程序检查,但在结构上仍然不切实际,,尤其是在私人领域……
arXiv:2608.06270
2026-08-10
cs.AI
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
"thinking-with-images"范式为多模式法学硕士配备了主动视觉操作,例如裁剪和缩放。然而,模型使用这些操作...
arXiv:2608.06294
2026-08-09
cs.AIcs.ET
QuanTiMedAI: Quantum-Enhanced Time-Series Model guided by Agentic AI for Cardiac Arrest Mortality Prediction
Mutasim Fuad Sarker, Adiba Rahman Namira, Wafa Binte Alam, Md Adnan Arefeen, Mahzabeen Emu, Sumaiya Tabassum Nimi
心脏骤停仍然是重症监护室遇到的最致命的情况之一。尽管电子医疗保健的可用性不断增加...
arXiv:2608.06300
2026-08-09
cs.AI
Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors
Arya Labroo, Mengjie Qian, Kate Knill
自动口语评估系统越来越多地部署在高风险环境中,以对第二语言(L2)学习者'口语测试,进行评分
arXiv:2608.06301
2026-08-09
cs.AIcs.CLcs.LG
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue
随着法学硕士越来越多地部署在代理系统中,,他们的能力不仅取决于模型权重,还取决于工具:,提示...
arXiv:2608.06305
2026-08-09
cs.AIcs.CLcs.IR
Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
Sagar Tamang, Ayush Vyas, Tabarakul Hazarika
长文档的检索增强生成主要由一种设计: 块文本, 嵌入块, 并显示 top-k 最近邻...
arXiv:2608.06346
2026-08-09
cs.AI
TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li
基于 LLM 的代理系统在复杂领域, 中表现出了卓越的能力,但同时也面临着级联错误和调试困难的问题。铬...
arXiv:2608.06351
2026-08-08
cs.AI
Challenges in Evaluating Explanation Methods for Static and Evolving Data
Jerzy Stefanowski
本文解决了可解释人工智能 (XAI) 在评估不足方面的局限性。它们通过...进行说明。
arXiv:2608.06361
2026-08-08
cs.AI
The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping
Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang
现实世界的视频基准测试提供了广泛的覆盖范围,,但其固定剪辑纠缠了事件计数, 速率, 持续时间, 和视觉复杂性, 导致失败......
arXiv:2608.06366
2026-08-08
cs.AIcs.LG
Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering
Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo
电子健康记录(EHR)特征工程是临床研究和AI,的主要瓶颈,占数据科学家'工作量的39-45%...
arXiv:2608.05102
2026-08-07
cs.AI
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
长视野搜索代理必须执行多个连续操作 (steps) 来搜索, 检索, 验证, 并整合证据以获得最终答案。 ...
arXiv:2608.05107
2026-08-07
cs.AIcs.MAcs.SE
CoPlan: A Trustworthy Co-Intelligence Interface for Care Planning through Role-Based Contestable Argument Graphs
Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao
AI 支持的护理计划可以帮助临床医生, 患者, 护理人员, 和护理团队协调临床, 功能, 心理方面的复杂决策...
arXiv:2608.05141
2026-08-07
cs.AIcs.LGcs.SE
OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling
Indraneil Paul, Falko Helm, Goran Glavaš, Iryna Gurevych
语言模型 (LMs) 的上下文长度急剧增加,,这是由于上下文学习的需求, 自我改进, 和长期视野...
arXiv:2608.05144
2026-08-07
cs.AI
Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks
Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng
长视野推理需要一个代理运行时间,当证据支持其当前方法时,该运行时间可以持续存在,并且当测量结果显示错误时,该运行时间可以持续存在......
arXiv:2607.28580
2026-08-02
cs.AI
DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li
虽然多模态检索增强一代 (MM-RAG) 已显示出有希望的结果,,但它仍然难以应对复杂的多跳推理任务。存在...
arXiv:2607.28609
2026-08-01
cs.AIcs.CLcs.CV
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
使用计算机的代理 (CUA) 正在数字世界中快速发展。 CUA 轨迹记录了代理的 操作, 状态, 和推理。维里...
arXiv:2607.28617
2026-08-01
cs.AIcs.CLcs.CYcs.HC
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei
系统提示是开发人员配置的指令,用于管理人工智能应用程序中基础模型的行为。它们在整个公司中使用...
arXiv:2607.24649
2026-07-29
cs.AI
Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
Atharva Pandey, Gautam Jajoo
大型语言模型越来越多地用作社交模拟器,,包括用作综合调查受访者。大多数评估都会询问是否模拟...
arXiv:2607.24667
2026-07-29
cs.AI
Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
Maruthi Vemula, Neeraj Praneeth Gajula
具有有限工作记忆的语言模型必须反复决定保留哪些存储项。每个部署的方法都会决定项目到达的那一刻...
arXiv:2607.24707
2026-07-29
cs.AIcs.CVcs.DB
ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams
Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut
实体关系图 (ERDs) 是概念数据库设计的核心,,但它们通常仅作为渲染图像而不是主...
arXiv:2607.22525
2026-07-28
cs.AI
Explainable Reinforcement Learning for assisting Air Traffic Controllers
Anduel Mehmeti, Gabriella Gigante, Salvatore Venticinque
为了有效地将人工智能集成到高风险,关键环境中,例如医疗保健,自动驾驶,和航空——并朝着更高的方向前进......
arXiv:2607.21495
2026-07-27
cs.AIcs.ETcs.MA
Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry
Natan Levy, Harel Berger
人工智能代理越来越多地由非工程用户通过低代码,、无代码, 和对话式开发环境在组织内部创建......
arXiv:2607.21503
2026-07-27
cs.AIcs.IR
Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
Gaurav Dadhich
生产型 AI 代理的故障较少是由于无法良好推理而导致的,而更常见的是因为他们无法管理推理中的内容......
arXiv:2607.21518
2026-07-27
cs.AI
Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
Linjun Li
即使是当前的高能力法学硕士,在直接显示危险目标时也会比其他代理转变并传递其方向时显得更安全......
arXiv:2607.21547
2026-07-27
cs.AIcs.CLcs.ETcs.LGcs.MA
The Boundaries of Automation: A Theory of Persistent Human Participation
Fares Fourati, Hinrich Schütze, Eyke Hüllermeier, Iryna Gurevych
人工智能的快速进步强化了长期以来对自动化:的追求,尽可能用算法代替人类参与。进出口...
arXiv:2607.21552
2026-07-27
cs.AIcs.LG
MIRROR: Learning from the Other View for Multi-Modal Reasoning
Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma
与表现出强大推理能力的大型语言模型 (LLMs) 不同, 视觉语言模型 (VLMs) 即使在...上也很难进行视觉推理,
arXiv:2607.21557
2026-07-26
cs.AIcs.CL
OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao
现代 AI 代理依靠复杂的推理工具(例如 Claude Code, Codex, 和 OpenClaw)来驱动多轮推理, 工具使用, 并访问...
arXiv:2607.21558
2026-07-26
cs.AI
Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning
Baihui Wang, Bernard Koch
构建社会校准的大型语言模型,,它可以向他人学习,而不是简单地屈服于他们, 需要的不仅仅是减少阿谀奉承......
arXiv:2607.21559
2026-07-25
cs.AIcs.CEcs.ETstat.APstat.ML
Unsupervised Consensus-Based Anomaly Detection for Spatiotemporal Malaria Incidence in Ghana
T. Ansah-Narh, Y. Asare Afrane
将共识异常检测框架应用于加纳(2014-2023) 的每月疟疾监测数据,以识别非典型传播模式...
arXiv:2607.20402
2026-07-24
cs.AI
SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data
Wael AbdAlmageed
在许多推理问题, 中,前提并不是作为离散符号, 观察到的,而是必须从高维输入中推断出来。进一步,谓词...
arXiv:2607.19262
2026-07-23
cs.AI
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman
随着病原体基因组监测规模扩大,,瓶颈正在从数据生成转向分析。我们提出 BioSecBench-Surveillance, 可验证...
arXiv:2607.19297
2026-07-23
cs.AIcs.SE
Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes
Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola
本文是业务流程中长期运行, 有状态, 多步骤生成式人工智能系统的基于图的工作流程路径的从业者指南...
arXiv:2607.19300
2026-07-23
cs.AIcs.GT
LLM Detection as an Intervention: Downstream Impact under Strategic User Behavior
Meena Jagadeesan, Tatsunori Hashimoto, Jon Kleinberg
随着 LLM 的采用变得更加广泛,,人们对检测 LLM 生成的内容, 越来越感兴趣,例如通过 LLM 检测工具和技术...
arXiv:2607.19321
2026-07-22
cs.AIcs.CRcs.LG
ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko
随着 AI 代理开始自动化 AI R&D,,我们需要方法来评估其输出是否可以安全部署,,即使代理本身可能不可信......
arXiv:2607.19327
2026-07-22
cs.AI
Associative Emotional Learning in Convolutional Neural Networks
Seowung Leem, Andreas Keil, Mingzhou Ding, Ruogu Fang
联想情绪学习使生物体能够适应性地将愉快或不愉快的结果与预测刺激的存在联系起来。而康...
arXiv:2607.19336
2026-07-22
cs.AIcs.CL
Agents in the Wild: Where Research Meets Deployment
Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
代理系统大型语言模型(LLM)基于架构,能够推理,规划,行动,并与工具和其他代理协调...
arXiv:2607.19338
2026-07-22
cs.AI
CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang
编码代理越来越多地在可执行环境中运行,其中失败的尝试会产生可操作的反馈,而不仅仅是错误的答案......
arXiv:2607.18116
2026-07-22
cs.AIcs.CVcs.GRcs.MAcs.MM
SGA: Plug&Play Geometric Verification for Educational Video Synthesis
Lopez Jhon, Hinojosa Carlos, Ghanem Bernard
最近的工作利用大型语言模型 (LLMs) 使用 Manim 等库生成教学动画的可执行代码。然而,随之而来...
arXiv:2607.18228
2026-07-22
cs.AIcs.CL
Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes
Brian K Chen
为了测试正确的逻辑判断如何响应学习的上下文,,我们在精确标记的三段论推理基准之前添加一个软前缀,同时......
arXiv:2607.15142
2026-07-20
cs.AIcs.LG
Improving Weak World Models Behind Strong Agents in Atari Pong
Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen
强世界模型代理经常包含弱世界模型。我们通过在 A 中再现五个视觉世界模型代理来研究这种代理世界模型差距。
arXiv:2607.15164
2026-07-20
cs.AIcs.CY
The Industrialization of Research ; On AI-Driven Science and Its Consequences
Emmanuel Jeannot
人工智能正在改变科学研究——不仅作为一种更强大的工具,,而且作为研究的自主参与者......
arXiv:2607.15166
2026-07-20
cs.AIcs.CL
MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
Goktug Ozkan
大多数医疗人工智能基准测试都会衡量模型是否知道正确答案。 MedFailBench 提出了一个不同的问题: 哪个安全边界失败了? 我们...
arXiv:2607.15176
2026-07-20
cs.AIcs.CLcs.HC
Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
Patrick Phuoc Do, Chau M. Ta, Chaoli Wang
多模态大语言模型 (MLLMs) 越来越多地用于解释可视化,,但当前的评估仍然主要以图表为中心,并且...
arXiv:2607.15190
2026-07-20
cs.AI
Can We Trust Item Response Theory for AI Evaluation?
Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang
AI 基准越来越多地利用项目级统计模型, 特别是项目响应理论 (IRT), 来估计模型能力, 排名系统...
arXiv:2607.15193
2026-07-19
cs.AI
Plover: Steering GUI Agents through Plan-Centric Interaction
Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu
图形用户界面 (GUI) 自动化在现实环境中仍然具有挑战性,,其中动态布局, 意外对话框, 和不断发展的交互...
arXiv:2607.15202
2026-07-19
cs.AIcs.HCcs.MAcs.MM
Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation
Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao
注释质量是为心理健康研究构建可靠且可解释的人工智能 (XAI) 系统的主要瓶颈。在深度...
arXiv:2607.15218
2026-07-19
cs.AIcs.CR
When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space
Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu
大型语言模型 (LLMs) 越来越多地充当具体代理的高级规划器,,其中语言上良性的指令可能变得不安全......
arXiv:2607.15247
2026-07-19
cs.AI
AutoSynthesis: An agentic system for automated meta-analysis
Moein Taherinezhad, Sebastian Maier, Gerardo Vitagliano, Francesco Pierri, Stefan Feuerriegel
证据综合对于将初级研究转化为科学, 医学, 教育, 和政策的可靠知识至关重要。然而,定量评估...
arXiv:2607.15254
2026-07-19
cs.AIcs.HC
teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data
Qiwei Li, Jorge Ortiz
交通机构现在可以访问大量视频数据来研究安全和拥堵情况。这些数据大部分是观察性的并且...
arXiv:2607.15257
2026-07-18
cs.AIcs.IR
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou
工具集成大型语言模型的最新进展使网络搜索成为信息查找代理的核心能力。然而,作为交互...
arXiv:2607.15267
2026-07-18
cs.AIcs.CL
Pretraining Data Can Be Poisoned through Computational Propaganda
Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo
破坏预训练数据可能会给 LM 带来难以检测和缓解的有害行为。先前关于中毒预训练数据的工作......
arXiv:2607.13013
2026-07-16
cs.AIcs.SD
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal
自动语音识别主要由一次发出一个标记的自回归解码器主导。我们问离散扩散语言模型是否......
arXiv:2607.13034
2026-07-16
cs.AIcs.CLcs.SEeess.SY
Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
Junjie Yin, Xinyu Feng
大型语言模型 (LLM) 代理越来越多地实现多步骤工程和信息学工作流程的自动化,,但他们很少询问一项任务需要付出多少努力...
arXiv:2607.08554
2026-07-13
cs.AI
CommuniWave:A Machine Learning Model for Quantifying the Degree of Temporary Informal Behavior in Urban Communities
Hongye Yang, Shien Liu, Zhihao Xie
对于城市管理者和设计师, 改善城市社区的功能属性,以增强面对复杂性的领土弹性......
arXiv:2607.08573
2026-07-13
cs.AI
SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits
Adis Alihodzic, Selma Skopljakovic Hubljar
多模态情感和情感识别通常通过早期融合, 来解决,早期融合, 在分类, 或后期融合之前连接模态...
arXiv:2607.08602
2026-07-13
cs.AI
Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance
Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong
肝细胞癌 (HCC) 是一种常见的恶性肿瘤,也是癌症相关死亡的主要原因。当前的指南和分期系统提供...
arXiv:2607.08625
2026-07-13
cs.AIcs.CL
The complexities of patient-centred conversational artificial intelligence
João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar
由大型语言模型 (LLMs) 提供支持的面向消费者的健康聊天机器人越来越多地用于症状评估。然而, 聊天机器人开发和...
arXiv:2607.08652
2026-07-13
cs.AI
Formal Mechanisms for Market Stability in Self-Interested Agent Societies: A Marketplace Simulation Study
Eugene Ng Yi Sheng, Bingquan Shen
自私的代理人,不受约束,倾向于在重复的社会困境中叛逃,,导致贸易合作收益崩溃。这 ...
arXiv:2607.08681
2026-07-12
cs.AIcs.ETcs.LGcs.MAecon.GN
SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets
Shilin Ou, Yifan Xu, Luyao Zhang
随着代理人工智能系统越来越多地应用于网络物理环境,,他们的评估需要评估任务绩效和信任......
arXiv:2607.08716
2026-07-12
cs.AIcs.CL
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
在长期任务中,, 决策相关状态通常分散在不断扩展的轨迹, 上,而行动代理必须将其浮现出来并采取行动。作为...
arXiv:2607.08734
2026-07-12
cs.AI
The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs
Baha Rababah, Shahzeb Qamar, Lorenz Sparrenberg, Rafet Sifa, Murat Kantarcioglu, Cuneyt Gurcan Akcora, Carson K. Leung
训练后量化已广泛用于压缩大型语言模型,使其可部署在资源受限的设备上。然而,...
arXiv:2607.08740
2026-07-11
cs.AIcs.PLcs.SE
Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows
Emanuele Quinto, Carlo Andrea Rozzi, Francesco Zanitti
大型语言模型 (LLM) 应用程序越来越多地使用显式工作流程来进行工具使用, 检索, 分支, 检查点, 和人工审批。埃西...
arXiv:2607.08745
2026-07-11
cs.AIcs.CV
AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita
视觉语言模型,大型语言模型,和多模态大型语言模型的最新进展改善了自动驾驶任务,例如......
arXiv:2607.08748
2026-07-11
cs.AIcs.HC
Using AI-based Learning Assistants in Higher Education: A Large-Scale Descriptive Analysis
Kristina Schaaff, Quintus Stierstorfer, Valerie Hekkel
在这项研究,中,我们对基于人工智能的学习助手(Syntea)在高等教育中的使用进行了大规模的描述性分析。基于对象...
arXiv:2607.08758
2026-07-11
cs.AI
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
科学思想很少是从白纸开始的。他们继承了机制, 修复已知的局限性, 并重新组合早期工作, 的各个部分,就像双...
arXiv:2607.07695
2026-07-10
cs.AIcs.GTcs.MA
Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety
Yujiao Chen
我们引入机构红队,一种用于测试多智能体AI中的部署规则的评估方法:持有代理,目标,和任务...
arXiv:2607.06519
2026-07-09
cs.AI
FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference
Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera
长上下文 LLM 推理越来越受到 KV 缓存, 的内存和带宽成本的限制,但积极的压缩可以消除层规范...
arXiv:2607.06522
2026-07-09
cs.AIcs.CV
Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang
视觉语言模型 (VLMs) 很难在交互式物理推理, 中进行泛化,特别是在看不见的任务和环境下。两把钥匙失效了...
arXiv:2607.06523
2026-07-09
cs.AI
DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
长上下文语言模型推理越来越受到存储键值缓存所需的内存带宽和容量的限制, 但现有的 co...
arXiv:2607.06531
2026-07-09
cs.AIcs.LG
The Large Cancer Assistant (LCA): A Model-Agnostic Orchestration Framework for Scalable Clinical Decision Support in Oncology
Ghassen Marrakchi, Basarab Matei
- Objective: 肿瘤学中的多模态深度学习模型目前受到严格耦合数据摄取的整体设计的限制, 临床路线...
arXiv:2607.06544
2026-07-09
cs.AIcs.CL
Rethinking Indic AI from a Lens of Cultural Heritage Preservation
Aparna Madva, Sharath Srivatsa, Srinath Srinivasa, Tulika Saha
随着人工智能(AI) 进入印度次大陆, 的不同地区,人们对研究人工智能如何影响......产生了浓厚的兴趣。
arXiv:2607.05359
2026-07-08
cs.AI
Graph Sparse Sampling: Breaking the Curse of the Horizon in Continuous MDP Planning
Idan Lev-Yehudi, Vadim Indelman
在连续域的不确定性下进行规划对于自治系统, 至关重要,但计算要求较高。基于树的搜索方法,例如...
arXiv:2607.05363
2026-07-08
cs.AI
SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints
Dylan Zongmin Liu
个人代理正在成为持久的用户拥有的中介: 他们记住偏好, 过滤平台介导的信息, 使用工具, 并否定...
arXiv:2607.05391
2026-07-08
cs.AIcs.CLcs.LGcs.MAcs.RO
LLM-as-a-Verifier: A General-Purpose Verification Framework
Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
扩展训练前,、训练后, 和测试时计算已成为提高法学硕士能力的核心范例。在这项工作,中,我们...
arXiv:2607.02303
2026-07-07
cs.AI
A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
Wanyun Cui
线性注意力和状态空间语言模型将前缀压缩为固定大小的循环状态,,以有损前的代价产生 O(1) 内存...
arXiv:2607.02329
2026-07-07
cs.AI
Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
Haonan Huang
自主研究代理已经在机器学习沙箱中展示了端到端的法学硕士自动化,其中执行提供了校准。前沿PH...
arXiv:2607.02374
2026-07-07
cs.AI
DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models
Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy
个性化改变了模型对用户所说的内容; 我们表明,它还可以改变用于证明响应合理性的推理轨迹。现代法学硕士...
arXiv:2607.02376
2026-07-07
cs.AIcs.MA
Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi
代理人工智能的最新进展正在产生日益复杂的自主系统,这些系统集成了大型语言模型,世界模型,优化e...
arXiv:2607.02389
2026-07-06
cs.AIcs.CRcs.SE
Steerability via constraints: a substrate for scalable oversight of coding agents
Thomas Winninger
编码代理有能力; 人类监督是瓶颈。不受约束的代理会带来安全风险, 侵蚀代码库可扩展性, 并使人...
arXiv:2607.02396
2026-07-06
cs.AIcs.LG
Fast Multi-dimensional Refusal Subspaces via RFM-AGOP
Thomas Winninger
大型语言模型 (LLMs) 中的引导和监控激活越来越多地用于安全性和可解释性。早期的工作假设是...
arXiv:2607.02407
2026-07-06
cs.AIcs.CV
Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments
Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao
大型语言模型 (LLMs) 在曼哈顿环境的 3D 室内合成中表现出了卓越的能力。然而,现有方法...
arXiv:2607.02432
2026-07-05
cs.AIcs.CLcs.CY
Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach
Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J.Rodriguez-Martinez, Lorena Otero-Cerdeira
命令行考试的可扩展且可靠的评分仍然是计算教育, 中的一个挑战,其中入学人数的增加使得手动评分变得困难...
arXiv:2607.02440
2026-07-05
cs.AIcs.CL
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang
人们越来越期望自主代理通过反馈来改进可执行政策,,但现有的评估经常将这一过程分解为……
arXiv:2607.02491
2026-07-05
cs.AI
G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models
Timo Bertram, Sidhant Bhavnani, Richard Freinschlag, Erich Kobler, Andreas Mayr, Günter Klambauer
在这项工作, 中,我们重点关注 SE-RRM,,这是 RRM 的符号等变实例,它对更大的问题规模表现出改进的外推能力。我们建议...
arXiv:2607.02507
2026-07-05
cs.AIcs.CLcs.LGcs.MA
What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh
LLM 代理人将越来越多地在社会结构环境中行动,其中角色, 受众, 和关系背景可以决定什么是有利的或昂贵的......
arXiv:2607.02509
2026-07-05
cs.AI
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He
对长上下文的理解和推理已成为在实际应用程序中部署大型语言模型 (LLMs) 的关键要求。阿尔斯...
arXiv:2607.02510
2026-07-04
cs.AIcs.CLcs.LGstat.APstat.ML
Online Safety Monitoring for LLMs
Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick
尽管进行了对齐培训,, LLM 仍然容易在部署时生成不安全的输出。在线监控输出并在安全时发出警报...
arXiv:2607.02514
2026-07-04
cs.AI
Distributed Attacks in Persistent-State AI Control
Josh Hills, Ida Caspary, Asa Cooper Stickland
随着人工智能编码代理变得更加自主,,他们越来越多地迭代地交付代码,,并且代码库在会话之间持续存在。这种坚持让...
arXiv:2607.01223
2026-07-03
cs.AIcs.CLcs.LGcs.LOcs.SE
Theoria: Rewrite-Acceptability Verification over Informal Reasoning States
Michael Saldivar, Ben Slivinski
人工智能系统的 的答案何时应该可信? 形式证明助手提供确定性,但无法达到大部分问题分布; 标量法学硕士...
arXiv:2607.01224
2026-07-03
cs.AIcs.CLcs.MA
AutoMem: Automated Learning of Memory as a Cognitive Skill
Shengguang Wu, Hao Zhu, Yuhui Zhang, Xiaohan Wang, Serena Yeung-Levy
记忆专业知识是一种习得的技能:知道要编码什么,何时检索,以及如何组织知识——这种能力在认知科学中被称为……
arXiv:2606.30626
2026-07-01
cs.AI
DOPD: Dual On-policy Distillation
Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan
在策略蒸馏 (OPD) 通过使用密集的令牌级信号监督学生采样轨迹,提供卓越的容量传输。提供...
arXiv:2606.30639
2026-07-01
cs.AIcs.CL
Self-Evolving World Models for LLM Agent Planning
Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng
世界模型提供了一种原则性的方法,使长期 LLM 代理在执行前对行动后果具有远见: 的预测。然而,不...
arXiv:2606.27226
2026-06-29
cs.AIcs.CL
Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit Sahu
评估 LLM 输出仍然是 NLP 的主要瓶颈: 人类评估成本昂贵且缓慢, 词汇指标与人类判断相关性很差......
arXiv:2606.27277
2026-06-28
cs.AIcs.CV
EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting
Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao
地球观测(EO)预测旨在根据不断变化的气象条件下的卫星观测来预测未来地球表面的动态......
arXiv:2606.27286
2026-06-28
cs.AI
Simulation-based inference for rapid Bayesian parameter estimation in epidemiological models: a comparison with MCMC
Alina Bazarova, Johann Fredrik Jadebeck, Henrik Zunker, Carolina J. Klett-Tammen, Torben Heinsohn, Wolfgang Wiechert, Katharina Noeh, Stefan Kesselheim
机制流行病学模型广泛用于支持传染病预测和公共卫生决策。贝叶斯校准...
arXiv:2606.27287
2026-06-27
cs.AI
Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings
Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin
大型语言模型 (LLMs) 越来越多地用于筛选和排名求职者, 为候选人战略性地操纵...
arXiv:2606.27288
2026-06-27
cs.AIcs.LG
When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
Josef Chen
多模型 LLM 系统(例如路由, 投票, 级联, 融合, 和混合代理)用于击败单模型准确性。我们表明他们的...
arXiv:2606.27334
2026-06-27
cs.AI
Language-Based Digital Twins for Elderly Cognitive Assistance
Mohammad Mehdi Hosseini, Mohammad H. Mahoor, Hiroko H. Dodge
数字孪生已成为个性化医疗保健的一个有前途的范例,,可以对个人行为和健康轨迹进行建模。在c...
arXiv:2606.25996
2026-06-26
cs.AIcs.CLcs.LG
Autodata: An agentic data scientist to create high quality synthetic data
Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston
我们引入了 Autodata, 一种通用方法,使 AI 代理能够充当构建高质量训练和评估数据的数据科学家。我们展示...
arXiv:2606.26057
2026-06-26
cs.AIcs.CRcs.LG
The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems
Seth Dobrin, Łukasz Chmiel
AI 代理被授予对工具, API, 和其他基础设施, 的访问权限,使它们成为这些系统中的活跃主体。占主导地位的方法将...
arXiv:2606.24855
2026-06-25
cs.AI
OpenThoughts-Agent: Data Recipes for Agentic Models
Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt
代理语言模型极大地扩展了人工智能的应用,但公众对如何为具有广泛能力的培训数据进行管理却知之甚少……
arXiv:2606.23643
2026-06-23
cs.AI
TailorMind: Towards Preference-Aligned Multimodal Content Generation
Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie
个性化内容系统依赖于可用的 UGC,当缺乏合适的内容, 延迟, 或创建成本高昂时,就会陷入困境。虽然多式联运...
arXiv:2606.23672
2026-06-23
cs.AI
Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles
Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain
本文介绍了我们针对 NVIDIA Nemotron 模型推理挑战, 的算法创新,重点关注位操作难题。在此任务中,...
arXiv:2606.23673
2026-06-23
cs.AIcs.LG
PsyBridge: A Hybrid Intelligent Framework for Multi-Dimensional Mental Health Assessment and Decision Support
Sunil Wanjari, Manish Thakre, Aayushi Asole, Sharwari Raut, Kwabena Adu-Duodu, Yinhao Li, Stanly Wilson
心理健康评估通常依赖于孤立的筛查工具或数据驱动的模型,而这些工具往往缺乏可解释性和多维度...
arXiv:2606.20363
2026-06-23
cs.AI
Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining
Yuexing Hao, Xiaomin Li
显式技能库使使用计算机的代理更容易检查,,但仍不清楚是否可以从交互数据中挖掘此类库......
arXiv:2606.20381
2026-06-23
cs.AI
Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe
Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou
FP4 训练有望大幅降低 LLM 预训练, 的内存和计算成本,但当前的 FP4 硬件路径和配方, 包括...
arXiv:2606.20438
2026-06-23
cs.AI
Interpretable Sperm Morphology Classification via Attention-Guided Deep Learning
Zahra Asghari Varzaneh, Reza Khoshkangini, Thomas Ebner, Lars Johansson
男性不育是夫妻不育的主要原因, 通常与精子形态异常有关。虽然深度学习模型提供自动化分析...
arXiv:2606.20459
2026-06-23
cs.AI
Context-Aware Hierarchical Bayesian Modeling of IVF Laboratory Environmental Conditions
Zahra Asghari Varzaneh, Reza Khoshkangini, Pia Saldeen, Lars Johansson, Thomas Ebner
IVF 妊娠率通常使用患者水平变量, 进行建模,而高分辨率实验室环境数据仍未得到充分利用。我们 ...
arXiv:2606.20508
2026-06-22
cs.AIcs.LG
What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?
Sihui Dai, Mann Patel
先前的工作表明,上下文演示可以越狱语言模型,,但仍不清楚模型如何解释不同类型的计算机...
arXiv:2606.20517
2026-06-21
cs.AIcs.PL
Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev
LiveCodeBench (LCB) 最近已成为广泛采用的基准,用于在代码生成任务上评估大型语言模型 (LLMs)。通过策划...
arXiv:2606.20518
2026-06-21
cs.AI
FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS
Harshit Singh, Ayush Pratap Singh, Nityanand Mathur
流匹配文本到语音系统实现了卓越的零样本质量,但在部署后保持静态: 词汇外发音错误...
arXiv:2606.20526
2026-06-21
cs.AI
DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs
Saimun Habib, Vaishak Belle, Fengxiang He
DeepProbLog 等神经符号系统将神经感知与概率逻辑相结合,,但标准推理是关联的。反事实...
arXiv:2606.20529
2026-06-21
cs.AIcs.CL
LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents
Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral
客户服务域中遵守策略的工具调用代理必须在调用工具并遵守域策略的同时保持轮流任务状态......
arXiv:2606.20532
2026-06-20
cs.AI
How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech
Nityanand Mathur, Hamees Sayed, Wasim Madha, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath
样式字幕文本转语音系统使用自然语言来控制语音特征,,但单个单词如何影响声音输出仍然是......
arXiv:2606.20544
2026-06-20
cs.AIcs.LG
Toward Calibrated Mixture-of-Experts Under Distribution Shift
Gina Wong, Drew Prinster, Suchi Saria, Rama Chellappa, Anqi Liu
校准将模型的的预测不确定性与其经验结果的频率保持一致,对于理解和信任代表很重要......
arXiv:2606.19245
2026-06-19
cs.AIcs.LG
TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology
Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman
人工智能(AI)代理承诺通过压缩解释和决策循环来加速药物发现,但实际部署...
arXiv:2606.19256
2026-06-19
cs.AI
X+Slides: Benchmarking Audience-Conditioned Slide Generation
Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu
从源文档自动生成幻灯片是大型语言模型(LLMs) 的一个重要应用。现有基准主要...
arXiv:2606.19279
2026-06-19
cs.AIcs.LGcs.LOmath.CTmath.LOmath.PR
NeSyCat Torch: A Differentiable Tensor Implementation of Categorical Semantics for Neurosymbolic Learning
Daniel Romero Schellhorn, Till Mossakowski, Björn Gehrke
神经符号语义是支离破碎的:经典,模糊,概率和神经系统每个都通过自己的归纳规则定义真理。 NeSyCat, 扩展...
arXiv:2606.19327
2026-06-19
cs.AIcs.CL
Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying
推理语言模型的后训练通常由具有可验证奖励的监督蒸馏和强化学习驱动。蒸馏...
arXiv:2606.18206
2026-06-18
cs.AI
Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers
Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Rusch, Antonio Orvieto
循环架构为学习需要组合推理的任务的逐步过程提供了归纳偏差。电子数量...
arXiv:2606.18235
2026-06-18
cs.AI
EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation
Qi Chai, Wenhao Shen, Nanjie Yao, Yue Xia, Kaiyong Zhao, Jie Ma, Guosheng Lin, Hao Wang
零射击对象目标导航 (ZS-OGN) 需要具体代理在没有任何事先训练的情况下探索和定位目标对象。为此,最近...
arXiv:2606.16995
2026-06-17
cs.AIcs.LG
When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning
Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues
强化学习 (RL) 策略在不熟悉的环境中通常会退化,因为它们缺乏明确的深思熟虑。我们建议计划, 对齐, 提交,...
arXiv:2606.17005
2026-06-17
cs.AIstat.ME
Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations
Yanan Long
公共人工智能评估通常被解读为终端排行榜,,但潜在的证据是由报告规则, 基准形成的选择性时间序列...
arXiv:2606.14579
2026-06-16
cs.AI
VISTA: View-Consistent Self-Verified Training for GUI Grounding
Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu
当应用组相对策略优化 (GRPO) 进行 GUI 基础时, 部署是从单个屏幕截图视图中采样的; 组通常变得...
arXiv:2606.14582
2026-06-16
cs.AI
A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems
Pollob Chandra Ray, Sabah Binte Noor, Fazlul Hasan Siddiqui
高效的线路优化对于确保铁路运营的安全和准点起着至关重要的作用。这是非常重要的,特别是在异国情调...
arXiv:2606.14654
2026-06-16
cs.AIcs.CLcs.LG
Abstracting Cross-Domain Action Sequences into Interpretable Workflows
Gaurav Verma, Scott Counts
顺序或带时间戳的交互日志提供了数字应用程序使用情况的客观记录,,但它们的粒度和噪音常常掩盖了平均值...
arXiv:2606.14672
2026-06-16
cs.AIcs.CL
Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows
Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li
大型语言模型越来越多地充当代理系统,的执行引擎,但它们仍然通过顺序文本接口消耗上下文......
arXiv:2606.13604
2026-06-15
cs.AIcs.LGcs.MA
Multi-Agent Reinforcement Learning from Delayed Marketplace Feedback for Objective-Weight Adaptation in Three-Sided Dispatch
Haochen Wu, Yi Hou, Shiguang Xie
三边市场中的调度为从世界反馈中进行强化学习提供了一个自然的环境: 决策是通过延迟操作来评估的...
arXiv:2606.13607
2026-06-15
cs.AI
Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning
Zach Studdiford, Gary Lupyan
当大型语言模型 (LLMs) 无法泛化或在推理中出现偶然错误, 时,通常会被视为 LLM 并不真正可靠的证据...
arXiv:2606.13608
2026-06-15
cs.AIcs.LG
AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility
Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song
代理系统正在跨领域快速发展,,但它们的评估仍然分散。大多数基准测试都依赖于固定, LLM 中心的工具,这些工具...
arXiv:2606.13621
2026-06-15
cs.AIcs.CRcs.GTcs.LGcs.MA
Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks
Achraf Hsain, Sultan Almuhammadi
屏蔽强化学习通常被视为一种运行时安全机制,它将时间逻辑规范编译成自动机限制...
arXiv:2606.13658
2026-06-15
cs.AI
Before You Think: System 0, AI-Mediated Cognition and Cognitive Colonization
Marianna Bergamaschi Ganapini, Massimo Chiriatti, Enrico Panai, Giuseppe Riva
本文研究了用于理解人工智能的认知和认知后果的三个最新框架: 三系统理论, ...
arXiv:2606.13662
2026-06-14
cs.AIcs.CL
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery
Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li
基于法学硕士的代理在自动化科学发现方面显示出越来越大的潜力。给定一个可优化的指标和一个执行环境,,他们可以...
arXiv:2606.13669
2026-06-14
cs.AI
Agents-K1: Towards Agent-native Knowledge Orchestration
Zongsheng Cao, Bihao Zhan, Jinxin Shi, Jiong Wang, Fangchen Yu, Zhijie Zhong, Yingnan Han, Zijie Guo, Tianshuo Peng, Zhuo Liu, Yi Xie, Xiang Zhuang, Shengji Tang, Yue Fan, Runmin Ma, Shiyang Feng, Xiangchao Yan, Anran Liu, Peng Ye, Wenlong Zhang, Xiaosong Wang, Shufei Zhang, Chunfeng Song, Fenghua Ling, Jie Zhou, Liang He, Bo Zhang, Lei Bai
目前基于 LLM 的研究代理已经通过代理编排, 取得了进步,但在很大程度上忽视了科学知识编排。现有作品...
arXiv:2606.13670
2026-06-13
cs.AI
Automated reproducibility assessments in the social and behavioral sciences using large language models
Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, Felix Henninger, Stefan Rose, Sarah Ball, Bolei Ma, Frauke Kreuter, Markus Weinmann, Stefan Feuerriegel
社会和行为科学中的可重复性通常由独立研究人员进行评估,他们重新分析原始数据以评估...
arXiv:2606.09809
2026-06-10
cs.AI
Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting
Avijit Ghosh, Anka Reuel, Jenny Chim, Wm. Matthew Kennedy, Srishti Yadav, Jennifer Mickel, Yanan Long, Andrew Tran, Anastassia Kornilova, Damian Stachura, Kevin Klyman, Felix Friedrich, Jeba Sania, Jan Batzner, Anoop Mishra, Eliya Habba, Yixiong Hao, Nathan Heath, Shalaleh Rismani, Usman Gohar, Andrea Loehr, David Manheim, Ruchira Dhar, Sree Harsha Nelaturu, Aarush Sinha, Leshem Choshen, Drishti Sharma, Ishan Khire, Amit Saha, Subramanyam Sahoo, Michael Hardy, Michael Alexander Riegler, Kabir Manghnani, Michelle Lin, Yanan Jiang, Yilin Huang, Asaf Yehudai, Jessica Ji, Aris Hofmann, Mubashara Akhtar, Max Lamparth, Nuno Moniz, Yacine Jernite, Stella Biderman, Zeerak Talat, Sanmi Koyejo, Mykel Kochenderfer, Irene Solaiman
AI 评估结果是大规模产生的,但在排行榜, 模型卡, 基准论文, 和公司博客中报告不一致。科斯...
arXiv:2606.07462
2026-06-09
cs.AI
Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle
Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao
随着基础模型的进步和智能体支架变得越来越复杂, 智能体已经在复杂的, 领域表现出了卓越的熟练程度...
arXiv:2606.07489
2026-06-09
cs.AIecon.GN
How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope
Jeremy Yang, Kate Zyskowski, Noah Yonack, Jerry Ma
前沿人工智能系统正在通过从对话助理转变为执行......的自主代理来缩小智能和实用之间的差距。
arXiv:2606.06356
2026-06-08
cs.AI
Where Should Knowledge Enter? A Layered Framework for Knowledge Infusion in Multimodal Iterative Generative Model
Renjith Prasad, Chathurangi Shyalika, Anushka Pawar, Aahan Rathod, Amit Sheth
多模态生成模型可产生流畅的输出,但当生成必须尊重结构化,、特定领域, 或安全关键时,仍然不可靠...
arXiv:2606.06360
2026-06-08
cs.AI
An Infectious Disease Spread Simulation Based on Large Language Model Decision Making
Yonchanok Khaokaew, Ruochen Kong, Andreas Zufle, Hao Xue, Taylor Anderson, Chandini Raina MacIntyre, Matthew Scotch, Flora D. Salim, David J Heslop
在传染病爆发期间对个人决策进行建模对于理解行为动态和为有效的公共信息提供信息至关重要...
arXiv:2606.06375
2026-06-08
cs.AI
Rethinking Infrastructure Inspection as Image Difference Classification: A Traffic Sign Case Study
Ching Yau Fergus Mok, Lavindra de Silva, Varun Kumar Reja, Ioannis Brilakis
数字孪生(DTs) 允许道路基础设施检查, 数字化,尽管这受到有限注释数据的阻碍。这项工作利用了...
arXiv:2606.06388
2026-06-08
cs.AIcs.CL
Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration
Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao
LLM 代理的最新进展实现了复杂的认知能力,,例如多步推理, 规划, 和工具使用,,这越来越多地...
arXiv:2606.06396
2026-06-07
cs.AI
Risk Assessment of Autonomous Driving: Integrating Technical Failures, Ethical Dilemmas, and Policy Frameworks
Boyi Chen, Shengqin Chu, Zicheng Wang, Brian Baetz, Zhen Gao
自动驾驶技术有潜力减少每年因人为失误造成的大量道路交通事故,,但它也带来了...
arXiv:2606.06416
2026-06-07
cs.AIcs.CLcs.LGcs.MA
Unsupervised Skill Discovery for Agentic Data Analysis
Zhisong Qiu, Kangqi Song, Shengwei Tang, Shuofei Qiao, Lei Liang, Huajun Chen, Shumin Deng
推理时技能增强提供了一种轻量级的方法来改进数据分析代理,通过注入可重用的程序知识而无需更新...
arXiv:2606.06448
2026-06-05
cs.AI
Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads
Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe
LLM 智能体越来越多地部署在需要对长期交互历史进行持续推理的长期任务上。大规模地意识到这一点......
arXiv:2606.06453
2026-06-05
cs.AI
Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen
随着生成长度的不断增长,稀疏注意力对于服务大型语言模型 (LLMs) 变得越来越重要。然而, 部署...
arXiv:2606.06462
2026-06-05
cs.AI
Benchmark Everything Everywhere All at Once
Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue
基准通过提供标准化和明确的绩效衡量标准,是评估和推进 LLM 和 MLLM 的基础。然而,他们的...
arXiv:2606.06468
2026-06-05
cs.AI
Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement
Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora
我们引入了 Goedel-Architect, ,这是一个在 Lean 4 中以蓝图生成和细化为中心的形式定理证明的代理框架。一张蓝图...
arXiv:2606.06473
2026-06-05
cs.AIcs.CL
MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery
Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai
大型语言模型 (LLM) 代理越来越多地应用于长期任务,例如科学发现和机器学习工程 (MLE), ...
arXiv:2606.05104
2026-06-05
cs.AI
Knowledge Index of Noah's Ark
Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang
LLM 的知识基准面临三个问题: 扩展驱动的设计无法实现学科代表性; 固定付款注释...
arXiv:2606.02530
2026-06-03
cs.AIcs.CL
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha
将大型语言模型 (LLMs) 与人类价值观保持一致通常会降低其一般能力,,称为对齐税。现有方法减轻了...
arXiv:2606.02536
2026-06-03
cs.AI
Tracking the Behavioral Trajectories of Adapting Agents
Jonah Leshin, Manish Shah, Ian Timmis
诸如技能文件, 内存文件, 和行为配置文件之类的文本文件在定义现代代理的行为方式方面发挥着核心作用。通过编辑...
arXiv:2606.02568
2026-06-03
cs.AIcs.CLcs.ETcs.MA
ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents
Yuxing Lu, Yushuhong Lin, Wenqi Shi, J. Ben Tamo, Xukai Zhao, Jinzhuo Wang, May Dongmei Wang
临床实践不是从列举的选项中选择答案: 医生逐渐收集异构信息并致力于...
arXiv:2605.31468
2026-06-02
cs.AI
AutoSci: A Memory-Centric Agentic System for the Full Scientific Research Lifecycle
Weitong Qian, Beicheng Xu, Zhongao Xie, Bowen Fan, Guozheng Tang, Jiale Chen, Xinzhe Wu, Mingtian Yang, Chenyang Di, Jiajun Li, Lingching Tung, Peichao Lai, Yifei Xia, Ziyi Guo, Yanwei Xu, Yanzhao Qin, Shaoduo Gan, Xupeng Miao, Bin Cui
科学研究传统上是人力密集型,,要求研究人员协调文献, 想法, 实验, 手稿, 和评论...
arXiv:2605.31492
2026-06-02
cs.AI
LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories
Liwei Kang, Yee Whye Teh, Wee Sun Lee
大型语言模型 (LLMs) 通常通过生成探索和修改部分解决方案的中间轨迹来解决推理问题。从搜索...
arXiv:2605.31581
2026-06-02
cs.AI
Choosing the Lens: Strategic Perspective Activation in Context-Dependent Argumentation
Albert Sadowski, Jarosław A. Chudziak
相同的论点常常需要在不同的外部制度下进行评估。对政权有影响力的特工拥有战略杠杆,可以...
arXiv:2605.30284
2026-06-01
cs.AI
ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure
A. J. Lew (1), Y. Cao (1), M. J. Buehler (1) ((1) Unreasonable Labs)
科学发现本质上是一个创造性和不确定性的过程,,需要超出已知知识回忆的推理。虽然许多基准...
arXiv:2605.30288
2026-06-01
cs.AI
MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection
Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai
中期培训已成为现代 LLM 发展, 的一个重要阶段,在最终的后期培训之前,使用大规模策划的混合物来增强能力。
arXiv:2605.30334
2026-06-01
cs.AIcs.CL
Demystifying Data Organization for Enhanced LLM Training
Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li
大型语言模型 (LLMs) 已经彻底改变了各个领域,,但它们的训练效率在很大程度上依赖于有效的数据管理。虽然达...
arXiv:2605.30335
2026-06-01
cs.AIcs.CL
Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents
Anany Kotawala
多组件 LLM 代理从组件中组装概率声明,每个组件仅看到联合问题的一部分; 该组合可能违反基本...
arXiv:2605.30344
2026-05-31
cs.AI
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
Xiaona Zhou, Muntasir Wahed, Tianjiao Yu, Constantin Brif, Ismini Lourentzou
视觉语言模型 (VLMs) 的最新进展在许多任务中取得了令人印象深刻的性能,,但之前的研究报告表现不令人满意...
arXiv:2605.30345
2026-05-31
cs.AIcs.CLcs.LG
SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations
Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu
印刷电路板 (PCB) 原理图设计定义了几乎所有电子硬件,,但它仍然需要大量手动和专业知识。虽然生成A...
arXiv:2605.30353
2026-05-30
cs.AIastro-ph.COcs.HCcs.SE
Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software
Nhat-Minh Nguyen
AI 代理是工具, 合著者, 还是研究人员? 我们提出了量化案例研究($N=1$): 监督 AI 编码代理的物理学家(Claude Code, ...
arXiv:2605.28763
2026-05-29
cs.AI
CubePart: An Open-Vocabulary Part-Controllable 3D Generator
Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou
游戏和模拟中使用的交互式 3D 资源通常被分解为特定的语义部分,以支持动画, 物理, 和脚本化 b...
arXiv:2605.28764
2026-05-29
cs.AIcs.DCcs.MA
SwarmHarness: Skill-Based Task Routing via Decentralized Incentive-Aligned AI Agent Networks
Edwin Jose
个人工作站上的大量计算 (GPU 周期, 闲置推理服务器, 和作业之间的边缘设备) 未使用,因为没有激励...
arXiv:2605.28792
2026-05-29
cs.AIcs.HCcs.LG
CaMBRAIN: Real-time, Continuous EEG Inference with Causal State Space Models
Abhilash Durgam, Nyle Siddiqui, Jeffrey A. Chan-Santiago, Qiushi Fu, Elakkat D. Gireesh, Mubarak Shah
脑电图(EEG) 是监测脑电活动的关键, 非侵入性方法。脑电图的跨度可以从几秒钟到......
arXiv:2605.28807
2026-05-29
cs.AI
Calibrating Conservatism for Scalable Oversight
William Overman, Mohsen Bayati
能够自主规划和扩展环境交互的代理人工智能系统提出了一个基本的控制问题:人类如何维持...
arXiv:2605.27361
2026-05-28
cs.AIeess.SY
Natural Language Query to Configuration for Retrieval Agents
Melissa Z. Pan, Negar Arabzadeh, Mathew Jacob, Fiodar Kazhamiaka, Esha Choukse, Matei Zaharia
现代检索代理公开了许多配置选择 - LLM, 检索器, 文档数, 跳数, 和合成策略 - 每个形状...
arXiv:2605.27366
2026-05-28
cs.AIcs.CLcs.LGcs.MA
MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang
大型语言模型 (LLM) 代理依靠可重用技能来解决复杂任务,,但现有的技能创建方法通常将技能视为孤立的......
arXiv:2605.26086
2026-05-27
cs.AI
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World
Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu
大型语言模型代理越来越多地被设想为永远在线的个人助理,可以访问用户 27 年代数字世界中的任何相关内容......
arXiv:2605.26112
2026-05-27
cs.AIcs.LG
From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
Shangding Gu
本文研究了代理 AI 的下一个主要瓶颈,因为系统扩展, 不仅是模型扩展:,还有可审计, 持久, 模块化, 的设计以及...
arXiv:2605.26114
2026-05-27
cs.AIcs.CL
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research
Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li, Bojiang Zhou, Zheng Ju, Zichen Liu, Lue Fan, Zhaoxiang Zhang
我们推出 MobileGym, 一个浏览器托管的, 轻量级, 完全可控的环境,适合日常移动使用, 目标是交互保真度,无需重新...
arXiv:2605.23899
2026-05-26
cs.AI
From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo
语言代理通过重用\emph{skills}(从过去的经验中提取的结构化程序工件)不断改进。特别是, \emph{...
arXiv:2605.23904
2026-05-26
cs.AIcs.CL
SkillOpt: Executive Strategy for Self-Evolving Agent Skills
Yifan Yang, Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou, Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo
如今的代理技能是手工制作的, 一次性生成的, 或通过松散控制的自我修订, 演变而来的,,其中没有一个表现得像深度学习...
arXiv:2605.22733
2026-05-25
cs.AIcs.SE
HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools
Edwin Jose
如今,部署为 LLM 工具的每个 Python 函数都必须以两种形式存在: 用于面向人类的客户端和 CI 管道的 HTTP 端点, 和一个 MCP...
arXiv:2605.22759
2026-05-25
cs.AI
Towards a General Intelligence and Interface for Wearable Health Data
Girish Narayanswamy, Maxwell A. Xu, A. Ali Heydari, Samy Abdel-Ghaffar, Marius Guerard, Kara Vaillancourt, Zhihan Zhang, Jake Garrison, Levi Albuquerque, Dimitris Spathis, Hong Yu, Hamid Palangi, Xuhai "Orson" Xu, David G.T. Barrett, Joseph Breda, Jed McGiffin, Yubin Kim, Yuwei Zhang, Naghmeh Rezaei, Samuel Solomon, Karan Ahuja, Tim Althoff, Jake Sunshine, Ming-Zher Poh, Benjamin Yetton, Ari Winbush, Nicholas B. Allen, James M. Rehg, Isaac Galatzer-Levy, Yun Liu, John Hernandez, Anupam Pathak, Conor Heneghan, Yuzhe Yang, Ahmed A. Metwally, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Xin Liu, Daniel McDuff
虽然无处不在的可穿戴传感器捕获了大量的行为和生理信息,,但有效地将这些信号转化为个性化...
arXiv:2605.22763
2026-05-25
cs.AI
Advancing Mathematics Research with AI-Driven Formal Proof Search
George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferraiuolo, Henryk Michalewski, Edward Lockhart, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri
大型语言模型 (LLMs) 越来越擅长数学推理,,但它们的不可靠性限制了它们在数学研究中的实用性。一个米特...
arXiv:2605.22773
2026-05-25
cs.AImath.OC
Deep Reinforcement Learning for Flexible Job Shop Scheduling with Random Job Arrivals
Yu Tang, Muhammad Zakwan, Efe Balta, John Lygeros, Alisa Rupenyan
灵活作业车间调度问题 (FJSP) 是一组作业到机器的最佳分配。 FJSP: 联合国仍然存在两个主要挑战...
arXiv:2605.22786
2026-05-24
cs.AIcs.ETcs.LGcs.MA
LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems
Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy
基于大型语言模型 (LLM) 的多代理系统越来越依赖中间通信来协调复杂的任务。虽然大多数现有...
arXiv:2605.22791
2026-05-24
cs.AI
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Ali Hatamizadeh, Yejin Choi, Jan Kautz
线性注意力用固定大小的循环状态,取代了softmax注意力的无界缓存,将序列混合减少到线性时间和解码...
arXiv:2605.22794
2026-05-23
cs.AIcs.LG
MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
Qianshu Cai, Yonggang Zhang, Xianzhang Jia, Huajiang Zheng, Wei Xue, Jun Song, Xinmei Tian, Yike Guo
自主代理系统在部署后基本上是静态的:,它们不会从用户交互中学习,,并且反复出现的故障持续存在,直到下一个......
arXiv:2605.21427
2026-05-22
cs.AIcs.DC
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
Can Hankendi, Rana Shahout, Minlan Yu, Ayse K. Coskun
大型语言模型 (LLM) 推理已成为现代数据中心的主要工作负载, 显着推动 GPU 利用率和能耗...
arXiv:2605.21458
2026-05-22
cs.AIcs.LGstat.ME
Mind the Sim-to-Real Gap & Think Like a Scientist
Harsh Parikh, Gabriel Levin-Konigsberg, Dominique Perrault-Joncas, Alexander Volfovsky
假设规划者有一个针对顺序决策问题的预训练模拟器,并且可以选择在现场运行真实实验。该模拟器是...
arXiv:2605.21481
2026-05-22
cs.AIcs.CLcs.LG
AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists
Junshu Pan, Panzhong Lu, Yixuan Weng, Qiyao Sun, Fang Guo, Zijie Yang, Qiji Zhou, Yue Zhang
人工智能 (AI) 的最新进展加速了人类创作和人工智能生成的研究成果的增长, 增加了...
arXiv:2605.21482
2026-05-22
cs.AI
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma
深入研究,,其中代理搜索开放网络, 收集证据, 并通过扩展推理得出答案, 是一个突出的用例...
arXiv:2605.20173
2026-05-21
cs.AIcs.SE
A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents
Vasundra Srinivasan
生产 LLM 代理将随机模型输出与确定性软件系统, 相结合,但两者之间的边界很少被视为一个界限...
arXiv:2605.16215
2026-05-19
cs.AIcs.CL
Fully Open Meditron: An Auditable Pipeline for Clinical LLMs
Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley
临床决策支持系统 (CDSS) 需要可仔细的, 可审计管道,以实现严格的, 可重复验证。然而目前基于法学硕士的 C...
arXiv:2605.16233
2026-05-19
cs.AIcs.CLcs.LGcs.MAeess.SY
FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast
Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman
LLM 代理能否通过自生成内存而无需梯度更新来改进决策? 我们建议 FORGE (Failure-Optimized Reflective Graduati...
arXiv:2605.16238
2026-05-19
cs.AI
Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search
Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi
传染病的概率预测对于公共卫生至关重要,但依赖于专家建模的劳动密集型手动模型管理...
arXiv:2605.15015
2026-05-18
cs.AIcs.CLcs.HC
Small, Private Language Models as Teammates for Educational Assessment Design
Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou
生成式人工智能越来越多地支持教育设计任务,,例如,通过大型语言模型(LLMs),展示了设计评估的能力...
arXiv:2605.15040
2026-05-18
cs.AIcs.CL
Orchard: An Open-Source Agentic Modeling Framework
Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao
代理建模旨在将 LLM 转变为能够通过规划, 推理, 工具使用, 和多回合解决复杂任务的自主代理...
arXiv:2605.15041
2026-05-17
cs.AIcs.CL
Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang
工具的使用将大型语言模型扩展到参数知识之外,,但可靠的执行需要平衡适当的推理深度与严格的......
arXiv:2605.15100
2026-05-17
cs.AI
Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling
Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan
大型语言模型 (LLMs) 表现出了卓越的推理能力。然而, 通过推理时间缩放来最大限度地发挥其潜力...
arXiv:2605.15109
2026-05-17
cs.AIcs.IR
Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG
Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz
检索增强生成可以通过将答案扎根于外部证据, 来提高事实性,但 Agentic GraphRAG 使其对公民的意义变得复杂化......
arXiv:2605.15132
2026-05-17
cs.AIcs.DCcs.MA
APWA: A Distributed Architecture for Parallelizable Agentic Workflows
Evan Rose, Tushin Mallick, Matthew D. Laws, Cristina Nita-Rotaru, Alina Oprea
基于大型语言模型 (LLMs) 的自主多智能体系统在独立解决复杂任务方面表现出了卓越的能力......
arXiv:2605.15177
2026-05-16
cs.AI
OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation
Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang
测试时计算扩展是改进 LLM 推理的主轴。现有的方法主要通过扩展单个推理轨迹来扩展深度......
arXiv:2605.13821
2026-05-15
cs.AIcs.LG
Harnessing Agentic Evolution
Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo
代理进化已成为通过迭代生成候选,来改进程序,工作流程,和科学解决方案的强大范例。
arXiv:2605.13825
2026-05-15
cs.AIcs.CV
History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions
Alberto G. Rodríguez Salgado
前沿法学硕士越来越多地被部署为代理,在由相同或不同的管理人员生成的大量先前工具调用日志后选择下一步操作。
arXiv:2605.13830
2026-05-15
cs.AIcs.LG
Quantifying Sensitivity for Tree Ensembles: A symbolic and compositional approach
Ajinkya Naik, Chaitanya Garg, S. Akshay, Ashutosh Gupta, Kuldeep S. Meel
决策树集成 (DTE) 是广泛的 AI 分类任务的流行模型, 用于多个安全关键领域,,因此非常...
arXiv:2605.12474
2026-05-14
cs.AI
Reward Hacking in Rubric-Based Reinforcement Learning
Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He
具有可验证奖励的强化学习在数学和编码等领域实现了强大的训练后收益,,尽管许多开放式设置...
arXiv:2605.12481
2026-05-14
cs.AI
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye
计算机使用代理 (CUAs) 可以通过原子 GUI 操作,(例如单击和键入,)和高级工具调用,(例如基于 API 的文件操作)进行操作...
arXiv:2605.08013
2026-05-12
cs.AI
Learning CLI Agents with Structured Action Credit under Selective Observation
Haoyang Su, Ying Wen
命令行界面 (CLI) 代理正在成为代理与计算机交互的实用范例,通过不断发展的文件系统, 可执行命令...
arXiv:2605.08019
2026-05-12
cs.AIq-bio.NC
Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners
Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov
人类在遇到新环境时快速学习抽象知识,并灵活运用这些知识来指导高效、智能的行为……
arXiv:2605.08024
2026-05-12
cs.AI
MPD$^2$-Router: Mask-aware Multi-expert Prior-regularized Dual-head Deferral Router in Glaucoma Screening and Diagnosis
Wenxin Zhan
学习推迟 (L2D) 可以通过将困难的/uncertain病例转交给人类,,使青光眼筛查更安全,但标准公式忽略了专家的意见...
arXiv:2605.08061
2026-05-12
cs.AI
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley
我们认为,将奖励分解为加权,可验证标准并使用LLM法官对其进行评分提供了部分学分优化信号......
arXiv:2605.08070
2026-05-12
cs.AI
VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection
James Petullo, Sonny George, Dylan Cashman, Nianwen Xue
扩展推理时间推理的标准技术是自我一致性,,其中多个候选答案是从法学硕士中抽取的,并且最...
arXiv:2605.06530
2026-05-11
cs.AI
SpatialEpiBench: Benchmarking Spatial Information and Epidemic Priors in Forecasting
Ruiqi Lyu, Alistair Turcan, Bryan Wilder
准确的流行病预测对于公共卫生应对,资源分配,和疫情干预,至关重要,但由于资源稀少,仍然很困难...
arXiv:2605.06540
2026-05-11
cs.AIcs.GT
Ex Ante Evaluation of AI-Induced Idea Diversity Collapse
Nafis Saami Azad, Raiyan Abdul Baten
创造性的人工智能系统通常在个人效用,的水平上进行评估,但创造性的产出却被群体所消耗:,一个想法就会失去价值......
arXiv:2605.06583
2026-05-10
cs.AI
Improved techniques for fine-tuning flow models via adjoint matching: a deterministic control pipeline
Zhengyi Guo, Jiayuan Sheng, David D. Yao, Wenpin Tang
我们提出了一个确定性伴随匹配框架,该框架为基于流的生成模型制定人类偏好对齐作为最佳控制...
arXiv:2605.06584
2026-05-10
cs.AI
NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research
Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi
多模态神经影像分析通常涉及复杂的, 模态特定预处理工作流程,需要仔细配置, 质量控制...
arXiv:2605.06614
2026-05-10
cs.AIcs.CL
SkillOS: Learning Skill Curation for Self-Evolving Agents
Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee
基于 LLM 的代理越来越多地被部署来处理流任务,,但它们通常仍然是一次性的问题解决者,无法从过去的经验中学习……
arXiv:2605.06623
2026-05-10
cs.AIcs.CLcs.LGcs.MA
MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems
Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang
基于大型语言模型 (LLM) 的多代理系统 (MAS) 在处理复杂的协作任务, 方面表现出了希望,其中代理通常是...
arXiv:2605.06638
2026-05-10
cs.AIcs.CL
Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key
Tianle Wang, Zhaoyang Wang, Guangchen Lan, Xinpeng Wei, Sipeng Zhang, Guanwen Qiu, Abulhair Saparov
强化学习(RL)已被应用于改进大型语言模型(LLM)推理,,但对训练如何随任务扩展的系统研究...
arXiv:2605.06641
2026-05-09
cs.AIcs.CV
GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation
Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu
由于复杂的化学成分,开发陶瓷釉料是一个成本高昂的,、耗时的反复试验过程,,给独立的……带来了沉重的负担。
arXiv:2605.06651
2026-05-09
cs.AI
AI co-mathematician: Accelerating mathematicians with agentic AI
Daniel Zheng, Ingrid von Glehn, Yori Zwols, Iuliya Beloshapka, Lars Buesing, Daniel M. Roy, Martin Wattenberg, Bogdan Georgiev, Tatiana Schmidt, Andrew Cowie, Fernanda Viegas, Dimitri Kanevsky, Vineet Kahlon, Hartmut Maennel, Sophia Alj, George Holland, Alex Davies, Pushmeet Kohli
我们推出了 AI 联合数学家,,这是数学家可以交互地利用 AI 代理进行开放式研究的工作台。人工智能数学...
arXiv:2605.05007
2026-05-08
cs.AI
Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation
Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem
大型语言模型 (LLM) 多代理系统通常依赖于严格的编排, 致力于平坦的每个查询路由或手工设计...
arXiv:2605.05017
2026-05-08
cs.AIcs.RO
Position: Embodied AI Requires a Privacy-Utility Trade-off
Xiaoliang Fan, Jiarui Chen, Zhuodong Liu, Ziqi Yang, Peixuan Xu, Ruimin Shen, Junhui Liu, Jianzhong Qi, Cheng Wang
嵌入式 AI (EAI) 系统正在迅速从模拟过渡到现实家庭和其他敏感环境。然而,最近的EAI所以...
arXiv:2605.05138
2026-05-08
cs.AI
Executable World Models for ARC-AGI-3 in the Era of Coding Agents
Sergey Rodionov
我们评估了 ARC-AGI-3 的初始编码代理系统,其中代理维护一个可执行的 Python 世界模型, 对照之前的 o...进行验证。
arXiv:2605.05191
2026-05-08
cs.AI
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents
Yijun Lu, Rui Ye, Yuwen Du, Jiajun Wang, Songhua Liu, Siheng Chen
长视野搜索代理必须管理快速增长的工作环境,因为它们推理,调用工具,并观察信息。天真地积累着一切……
arXiv:2605.04019
2026-05-07
cs.AIcs.CR
Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours
Raja Sekhar Rao Dheekonda, Will Pearce, Nick Landers
人工智能系统正在进入医疗保健,、金融,和国防,等关键领域,但仍然容易受到对抗性攻击。虽然人工智能红队是......
arXiv:2605.04036
2026-05-07
cs.AIcs.CL
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
Yuwen Du, Rui Ye, Shuo Tang, Keduan Huang, Xinyu Zhu, Yuzhu Cai, Siheng Chen
深度搜索能力已成为前沿大型语言模型(LLM)智能体,不可或缺的能力,但其发展仍然占据主导地位...
arXiv:2605.00440
2026-05-05
cs.AIcs.CLcs.HC
Role-Aware Artificial Intelligence Across Augmentation and Automation in Human-Machine Symbiosis
Ching-Chun Chang, Yuchen Guo, Hanrui Wang, Timo Spinde, Isao Echizen
人工智能(AI)的进化使得人类和计算机器之间的界限变得越来越模糊。在项目中...
arXiv:2605.00572
2026-05-05
cs.AImath.OC
Instance-Aware Parameter Configuration in Bilevel Late Acceptance Hill Climbing for the Electric Capacitated Vehicle Routing Problem
Yinghao Qin, Xinwei Wang, Mosab Bazargani, Jun Chen
组合优化中的算法性能对参数设置高度敏感,,而单个全局调整的配置经常失败......
arXiv:2605.00642
2026-05-05
cs.AIcs.CV
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
Yan Zhang, Daiqing Wu, Huawen Shen, Can Ma, Yu Zhou
图形用户界面(GUI)基础将自然语言指令映射到目标元素的视觉坐标,并作为核心功能...
arXiv:2605.00737
2026-05-05
cs.AI
To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling
Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar
代理人工智能架构通过外部工具, 增强了法学硕士,释放了强大的功能,但可能会产生大量成本。而且,工具还...
arXiv:2605.00742
2026-05-05
cs.AIcs.LGstat.ML
Position: agentic AI orchestration should be Bayes-consistent
Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev
法学硕士擅长预测任务和复杂推理任务,,但许多高价值部署依赖于不确定性, 下的决策,例如, 哪些...
arXiv:2604.28093
2026-05-04
cs.AI
What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design
Ivan Bercovich
终端代理基准测试已成为衡量大型语言模型的编码和系统管理能力的主要信号。作为...
arXiv:2604.28098
2026-05-04
cs.AIcs.CLcs.CY
Mapping the Methodological Space of Classroom Interaction Research: Scale, Duration, and Modality in an Age of AI
Dorottya Demszky, Edith Bouton, Alison Twiner, Sara Hennessy, Richard Correnti
课堂互动的研究长期以来分为大规模观察和深入的民族志工作。我们提出了一个框架映射...
arXiv:2604.28112
2026-05-03
cs.AIcs.LO
Splitting Argumentation Frameworks with Collective Attacks and Supports
Matti Berthold, Lydia Blümel, Giovanni Buraglio, Anna Rapberger
这项工作提出了论证形式主义的新颖分裂技术,其中结合了可废止元素之间的支持。我们的研究基础...
arXiv:2604.28125
2026-05-03
cs.AIcs.CYcs.HC
Normativity and Productivism: Ableist Intelligence? A Degrowth Analysis of AI Sign Language Translation Tools for Deaf People
Nina Seron-Abouelfadil, Poppy Fynes
任何地理或口音变化的手语, 可以理解的是,在口头命令的普遍流行下,手语, 面临着持续的审查...
arXiv:2604.28158
2026-05-03
cs.AI
Intern-Atlas: A Methodological Evolution Graph as Research Infrastructure for AI Scientists
Yujun Wu, Dongxu Zhang, Xinchen Li, Jinhang Xu, Yiling Duan, Yumou Liu, Jiabao Pan, Qiyuan Zhu, Xuanhe Zhou, Jingxuan Wei, Siyuan Li, Jintao Chen, Conghui He, Cheng Tan
现有的研究基础设施基本上是以文档为中心的,提供论文之间的引用链接,但缺乏对我的明确表示......
arXiv:2604.28178
2026-05-03
cs.AI
LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis
Lincan Li, Zheng Chen, Yushun Dong
脑电图(EEG) 信号对于自动癫痫检测, 至关重要,但其固有的噪声使稳健的表示学习面临挑战......
arXiv:2604.28181
2026-05-03
cs.AIcs.CLcs.LG
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao
现实的长期生产力工作很大程度上取决于用户特定的计算机环境,,其中存储了大部分工作上下文并......
arXiv:2604.26805
2026-05-01
cs.AIcs.MA
Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang
运营和维护(O&M)大型在线引擎系统(eg,搜索,推荐和广告)需要大量人力来重新...
arXiv:2604.24686
2026-04-29
cs.AI
Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents
German Marin, Jatin Chaudhary
自主人工智能代理可以保持完全授权,但随着行为漂移,对手适应,并且决策模式在没有...的情况下发生变化,仍然变得不安全。
arXiv:2604.24697
2026-04-29
cs.AI
Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft
Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao
发现因果规律并将其应用于构建功能系统(发现到应用循环)是通用智能的标志...
arXiv:2604.24710
2026-04-29
cs.AIcs.CL
Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez
客观的。临床 AI 文档系统需要临床有效, 经济可行, 且对迭代敏感的评估方法...
arXiv:2604.24717
2026-04-29
cs.AI
Learning to Rotate: Temporal and Semantic Rotary Encoding for Sequential Modeling
Hailing Cheng, Daqi Sun, Xinyu Lu
每个 Transformer 架构都致力于学习语义嵌入空间中丰富的表示的巨大能力 - 然而旋转流形...
arXiv:2604.21965
2026-04-28
cs.AI
Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
Benjamin Kohler, David Zollikofer, Johanna Einsiedler, Alexander Hoyle, Elliott Ash
最近的工作使用 LLM 代理来重现实证社会科学结果,并可访问数据和代码。我们通过询问: 来扩大这个范围...
arXiv:2604.22026
2026-04-28
cs.AIcs.CYcs.DL
Rethinking Publication: A Certification Framework for AI-Enabled Research
Yang Lu, Rabimba Karanjai, Lei Xu, Weidong Shi
人工智能研究渠道现在可以产生可以满足现有同行评审质量,新颖性,和方法严谨性标准的学术工作。哈...
arXiv:2604.22080
2026-04-28
cs.AI
Sound Agentic Science Requires Adversarial Experiments
Dionizije Fa, Marko Culjak
基于 LLM 的代理正在迅速被用于科学数据分析, 自动化任务,这些任务曾经受到人力时间和专业知识的限制。这个能力是...
arXiv:2604.22085
2026-04-27
cs.AI
Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents
Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel, Neel Patel, Majid Fekri, Tara Khani
从无状态语言模型推理到持久, 多会话自治代理的转变表明内存是主要架构...
arXiv:2604.22119
2026-04-27
cs.AI
Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
Tharindu Kumarage, Lisa Bauer, Yao Ma, Dan Rosen, Yashasvi Raghavendra Guduri, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris
随着推理能力和部署范围同步增长, 大型语言模型 (LLM) 获得了参与服务于自己的行为的能力......
arXiv:2604.22273
2026-04-27
cs.AI
Self-Correction as Feedback Control: Error Dynamics, Stability Thresholds, and Prompt Interventions in LLMs
Aofan Liu, Jingxiang Meng
迭代式自我修正越来越多地部署在代理 LLM 系统, 中,但重复细化是否会提高或降低性能仍然是一个问题。
arXiv:2604.22411
2026-04-27
cs.AIcs.CLcs.LG
Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models
Alberto Messina, Stefano Scotta
即使使用温度 $T=0$, 大型语言模型 (LLMs) 进行解码,也可以为相同的输入产生不同的输出。 Thinking Ma 的最新作品...
arXiv:2604.22428
2026-04-27
cs.AI
CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease
Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain
由于疾病进展的异质性,预测阿尔茨海默的疾病(AD)的个体认知能力下降很困难。可靠的临床...
arXiv:2604.22436
2026-04-27
cs.AIcs.IRcs.MA
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz
AI 代理生态系统的快速发展正在改变复杂任务的委派和执行方式,,这为识别合适的任务带来了新的挑战……
arXiv:2604.22446
2026-04-27
cs.AI
From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company
Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin Luo, Jun Wang
通过模块化技能和工具集成,单个代理的能力迅速提高,,但多代理系统仍然受到固定...
arXiv:2604.22452
2026-04-27
cs.AIcs.CLcs.LG
Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents
Xirui Li, Ming Li, Yunze Xiao, Ryan Wong, Dianqi Li, Timothy Baldwin, Tianyi Zhou
集体智慧是指一个群体取得超出任何单个成员单独所能完成的成果的能力。作为大语言...
arXiv:2604.22455
2026-04-27
cs.AI
On the Hybrid Nature of ABPMS Process Frames and its Implications on Automated Process Discovery
Anti Alman, Izack Cohen, Avigdor Gal, Fabrizio Maria Maggi, Marco Montali
任何 AI 增强业务流程管理系统 (ABPMS) 的核心组件是流程框架,,它为系统提供流程意识和定义...
arXiv:2604.22577
2026-04-27
cs.AIcs.CL
QuantClaw: Precision Where It Matters for OpenClaw
Manyi Zhang, Ji-Fu Li, Zhongao Sun, Xiaohao Liu, Zhenhua Dong, Xianzhi Yu, Haoli Bai, Xiaobo Xia
由于长上下文输入和多轮推理,OpenClaw 等自主代理系统带来了巨大的效率挑战。这个结果...
arXiv:2604.22597
2026-04-27
cs.AI
Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity
Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky
大型语言模型的最新进展导致了各种任务, 的显着改进,包括数学推理,,它使用...
arXiv:2604.22748
2026-04-27
cs.AI
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia
随着人工智能系统从生成文本转向通过持续交互完成目标,,对环境动态进行建模的能力成为一个中心......