Accepted Papers

We accepted 163 papers in total: 6 oral papers (top 2%), 9 spotlight papers (top 6%), and 148 poster papers. Among the accepted papers, 55 were non-archival and 108 were archival.

Oral Papers

Causal Decomposition of LLM Agent Failure via Oracle-State Intervention
Leqi Jia, Muhammad Saadat, Marlin Wong, Adithya Venkatesh, Kiran Nijjer
(archival)
Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents
Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier
(non-archival)
STAC: When Innocent Tools Form Dangerous Chains for LLM Agents
Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi
(archival)
CAPSafe: A Benchmark for Contextual Action and Plan Safety Reasoning in Embodied Agents
Youmna Farag, Svetlana Stoyanchev, Simon Keizer, Mohan Li, Rama Doddipatla
(archival)
Agents Repair — or Just Reply? Public Correction in Deployed Agent Forums
Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan
(non-archival)
The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks
Bardia Mohammadi, Lars Henning Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler
(non-archival)

Spotlight Papers

From Textbooks to Proactive Agentic Systems: Scaling Long-Horizon Planning via Automated Agentic System Construction
Mohamed Khelifi, Saif Daoud, Leena Babiker, Sami Ouanes, Mohammad Raza, Safa Messaoud
(non-archival)
Capture Is Easy, Forgetting Is Hard: Benchmarking Prospective Memory in Conversational Agents
Deniz Bilgin, Jonas Schewior, Andreas Wendemuth
(archival)
Research Agents Feed Doubts, Not Beliefs: Auditing Belief Framing in Live-Web Search
Siddharth Vohra, Min Xu
(archival)
Source Is Not Authority: Selector-Aware Provenance Authorization for Tool-Using Agents
Vedant Singh
(non-archival)
ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Henning Klein, Akhil Arora
(non-archival)
Failing Agents Leave Traces: Telemetry Signatures for Multi-Tier Agent Evaluation
Muthaheera Yasmeena Belgur Shamiullah
(archival)
SEDIMA: Cross-Run Hierarchical Insight Memory for Evolutionary Search Agents
Amirhossein Abaskohi, Mahdi Mostajabdaveh, Zirui Zhou
(archival)
CANDID: Candidate-Driven Intervention for Disciplined Execution in Local Computer-Use Agents
Woongkyu Lee, Jungwook Choi
(non-archival)
CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation
Yang Wu, Stefano Petrangeli, Ishita Dasgupta, Yu Shen
(archival)

Posters

Archival (100 papers)
Shared Selective Persistent Memory for Agentic LLM Systems
Sanjana Pedada, Aditya Dhavala, Neelraj J. Patil
Hydra: Adaptive Adversarial Attacks for Dynamic Multi-Stage Edge Intelligence Services
Linhan Li, Chuanqi Jiang, Wenqian Weng, Jacqueline J. Pang, Zhiguo Tao
Silent Locale Corruption: Diagnosing and Mitigating Chinese-Locale Semantic Failures in LLM Tool Calling
Ruiyang Zhang
Self-Correcting Large Language Models: Generation vs. Multiple Choice
Hossein A. Rahmani, Satyapriya Krishna, Xi Wang, Mohammadmehdi Naghiaei, Emine Yilmaz
Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories
Prakhar Khatri
Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation
Lijuan Tang, Yuemeng Zheng
When Is Agent Tool-Result Cache Reuse Actually Safe?
Liang Nie, Hehua Zhang
Authentic but Not Neutral: Selective Evidence in LLM-Agent Leaderboards
Xiaoxuan Li, Bangbang Liu, Ying Zhao
GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
Arunabh Srivastava, Mohammad A. Khojastepour, Srimat Chakradhar, Sennur Ulukus
Answer or Compute? Direct Inference vs. Code Generation for LLM Game-State Understanding in RTS Games
Chang Liu
Foundation First: Stabilizing SLM Agents via Pre-execution Logical Scaffolding
Juntae Lee, Jihwan Bang, Seunghan Yang, Sungha Choi
Agent Step Value: Auditing Evaluation-Channel Sensitivity in Black-Box Agent Traces
Andrew Zhang, Chengzhan Li
PRISM: Bounded Autonomy for LLM Agents via Workflow Projection and Deterministic Consequence Boundaries
Prasannjeet Singh
FUSE: Failure-Guided Scenario Synthesis and Weighted Refinement for LLM Function Calling
Zhiguo Tao, Linhan Li, Lifan Sun, Zichen Yuan
Is Progressive Disclosure All You Need for Long-Context Agents?
Yifeng He, Yinzhe Zhao, Jicheng Wang, Hao Chen
From Credit Assignment to Repair: A Leakage-Controlled Diagnostic Study of Tool-Using Agents
SHAOBO QIAO
When Should LLM Agents Forget? Memory Filtering Under Query-Critical Resolver Errors
Samarth Vinayaka
Do Query-Agnostic Memory Structures Earn Their Budget? A 10M-Token Audit with Exact Read Limits
Amit Maraj, Kannav Sethi
Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification
Yihang Chen, Pin Qian, Su Wang, Chong Peng, Huan Xu, Shuaiting Li, Yiqi Sun
Retrieval is Enough: A Memory-Augmented Agent for Algorithm Selection
Zhang Weizhou, Lixing Lyu
Decomposing Self-Reflection in LLM Agents: Diagnostic Scaffolds, Uncertainty Labels, and Action Diversity
Poli Nemkova, Haeshitha Indukuri
Agent-Readiness of Synthesized API Tools: Parametric Gravity and the Limits of Documentation Grounding
Teodora Stereciu, Baohao Liao, Christian Herold, Shahram Khadivi, Christof Monz
Where the Tokens Go: A Measured Anatomy of LLM Agent Trajectory Costs
Tommy Tran
Feedback Blindness: Diagnosing Silent Failures in Closed-Loop Agentic Data-Generation Pipelines
Loc Nguyen, Nguyen Khanh Long, Vu Gia Nam, Nguyen Tran Minh Nhat
Tool Quality, Not Framework Complexity: Evaluating RLM Vision, Code, and Memory Pipelines for Radiology Applications
Jonas Schewior, Ansari Hamid Raja Gulam, Mohamed Ashfaq Anwerdeen, Andreas Wendemuth
Autonomous Event Driven Multi-Agent Orchestration for Enterprise AI at Scale
Harsh Rao Dhanyamraju, Leonidas Raghav, Aaron Lee
ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems
Rista Baral, Akshey Sigdel
Same Answers, Different Active-Store States: An Identification Audit of FactConsolidation Single-Hop
Daeun Jeong, Yongjun Zhu
Externalizing Requirement-to-Repair Artifacts as Observable Traces for LLM-Based Program Repair
Zewen Tao, Shin-nosuke Ishikawa
Flight to Mediocrity: Why LLM Agent Selectors Under-Hire Experts When Quality Claims Are Unverified
Soham Wasmatkar
Translating the Translator: Decomposing the Cost of English-Forced Inter-Agent Communication
Kushagra Agrawal, Yuming Feng, Man-Fai Leung
Mo’ Models, Mo’ Problems: How to best select model pools when designing Multi-Agent Systems
Sara Vera Marjanovic, Jiacheng Xu, Aleksandr Laptev, Grigor Nalbandyan, Erik Arakelyan, Evelina Bakhturina
Be Careful Who You Trust: Coordination Dynamics under Corrupted Communication in LLM Multi-Agent Games
Xuanyi Liu, Niall Dalton, Hairi Amin, Xiyuan Yin, Lydia Lim
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents
Quang Dao, Purvi Kathalkar, Kenneth Eaton
ACIES: A Self-Evolving Agentic Contract-Based Framework for Cyber-Physical System Control Synthesis
Yifeng Xiao, Zhiyu Ni, Dinghong Song, Mi Zhou, Pierluigi Nuzzo
Capability Is Not Complementarity: A Routing Feasibility Study in Financial Question Answering
Rishi N. Simhadri
Generation and Verification: Human-Agent Collaboration for Safety-Critical Automotive Software Engineering
Elizaveta Zinovyeva, Aiham Taleb, Nikita Kozodoi, Daniel Schleicher, Amir Mahdi Namazi, Martin Kraus, Levent Kent, Brian Jensen
Two Thirds of the Best-of-K Oracle Band in Tool Agents Is Unreachable by Reward-Free Selection
Srinivas Harish
AIDG: A Formal Decomposition of Information Extraction and Containment Asymmetries in Multi-Turn LLM Dialogue
Adib Sakhawat, Fardeen Sadab, Rakin Shahriar
V-RAM: A Visual Retrieval-Augmented Multi-Agent Reasoning Framework for Medical Dialogue Diagnosis
Shukraditya Bose, Soumen Sinha, Ananya R Bhat, Rahul Roy
AgenticLOCI: A Multi-Agent Memory Framework for Conversational AI with Longitudinal Personalization
Jonas Schewior, Deniz Bilgin, Gonzalo Haefner, Andreas Wendemuth
When Hiring Becomes Agent-Mediated: Evaluating Access and Recurrence in Two-Agent Résumé Screening
Jian Gao, Hang Jiang
When Failures Propagate: Causal Failure Attribution in Agentic Retrieval-Augmented Generation
Lauren Pothuru
What Agent Benchmarks Don't Tell You: Recoverability and Credit Assignment in Agentic Retrieval Evaluation
Sai Krishna Rallabandi, Parag Pravin Dakle, Preethi Raghavan
When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Kumar Porwal, Honey Gupta
Beating a Random-Direction Bank Does Not Establish Policy Improvement: An Exact-Value Audit of Activation Steering for Agents
Avinash Goutham Aluguvelly
DySAS: Dynamic State-Aware Student Simulation Beyond Static Personas
Partha Sarathi Purkayastha, Heejin Do
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
Zixiang Liu, Wenrui Liu, Elsie Dai, Wenhan Yu, Lei Yu, Tong Yang, Yinjun Han, Hong Gao
Grounding First: Auditing a Structured Recovery Wrapper for Local Open-Weight Reflexion Agents
Nimay Ballal, BADRI PRASAD V R
What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Framework
Ioannis Prokopiou, Athanasios Aidinis, Panagiotis-Christos Kyrmpatsos, Pantelis Vikatos
Runtime Verification of Dimensional Semantics in Checkpointed Large Language Model Tool Workflows
Aditya Mazumdar
Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents
Hafsa Akbar, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama, Alex Pentland
EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-Scale Multi-Agent Systems
Shuang Xie, Yunan Lu, Han Li, Lingyun Wang
ExGQL: Self-Improving Natural Language-to-Graph Query Generation via Experience-Guided Learning
Penghong Guo, Boxin Du, Houliang Zhou, Chaman Gupta, Yina Gu, Rayssa Küllian, Shen Jiang
Environment Steering: Using Data Flow Control to Improve Agent Utility and Safety
Charlie Summers, Prajwal Raghunath, Aaditya Pai, Mayur Kulkarni, Zhuo Zhang, Oliver Kennedy, Eugene Wu
Role-Diverse Agent Forests for Neuroimaging Triage: When Does Prompt-Induced Role Diversity Help?
Tamara Kostova, Sonja Gievska
The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits
Siddharth Vohra, Manikandan Ravikiran
When Critics Go Stale: Benchmarking Safety Guardrail Degradation Under Environment Drift
Fatemeh Taheri Dezaki, Lakshman Kolasani, Ankita Bhaumik, Siddartha Sathyamoorthy Rao, Ayush Jain
Are LLM Shopping Agents Behaviorally Distinguishable from Human Shoppers? A Session-Level Study
Arka Dutta, Virinchi Roy Surabhi, Jiayue Tong, Dihan Dai, Olcay Boz, Amila Weerasinghe
BioSciReview-Bench: Benchmarking Coding Agents on Silent Scientific Bug Detection in Bioinformatics Code
Junhao Qiu
Do Tool Schemas Fully Specify Argument Binding?
Jai Kumar Sharma, Peeyush Tapadiya
Testing Behavioral Adaptation in Repeated Interactions Between LLM Agents
Lixin Liu, Yixuan Li, Xiankun Lin, Yutian Lu, Shiguang NI
CaseInterviewBench: Evaluating Agentic AI's Purpose-Reflective Autonomy to Uncover What the User Really Needs
Shin-nosuke Ishikawa, Masato Todo, Atsushi Yoshino, Hirotsugu OHBA
A Case Study of On-Premise ReAct for Collaborative Robot Programming
Yu-Seung Ma, Sangyeop Yeo
Causal Episodic Memory for Feedback-Driven Agent Repair
Khang Nhat Hoang Vo, Tam Minh, Anh Trac Duc Dinh, Thuyen Vinh Ha Bui, Tho Quan
Chronicle: Cut-Point Replay for Regression Testing of LLM Agents
Tisha Chawla, Susheem Koul
Contract Before Code: Failure-Compiled Contracts for Long-Horizon Coding Agents
Jiangnan YU, Kisson Songqi Lin
DeepRewind: Predicting and Repairing Premature Commitments in Deep Research Agents
Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Lele Wang, Peter West, Giuseppe Carenini
BirdsongChat: A Hybrid Multi-Agent Framework for Interactive Multimodal Embodied Behavior Simulation
Callie C. Liao, Duoduo Liao, Ellie L. Zhang
An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios
Hankyul Baek, Jaewon Noh, Sang Seo, Yongsu Kim, Gabriel Waikin Loh Matienzo, Young Il Kim, Ee Wei Seah, Akriti Vij
GLOBE: Evolving Structured Agentic Memory for E-commerce Product Optimization in Generative Search
Hyunseo Kim, Suil Choe, Sukkyoung So, Daeyeon Yi
COMPASS: Critique-guided Optimization of MetaPolicies for Agentic Systems with Reinforcement Learning
Krishna Sayana, Ketan Kumar Todi, Ambarish Jash, Sukhdeep Sodhi
From Trajectories to Workflows: Online Procedural Memory Abstraction for Language Agents
Swathi Shree Narashiman, Ishan Jindal, Mahesh Chandran
Prior-History Sensitivity in Agentic Safety Evaluations
Melat Ghebreselassie, Melissa Li
CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
Wuya Chen, Yihao yang, Yang Cao, Yue Lin
SkillCombiner: Optimizing Agent Skills via Edit Combination Search
Seungbeom Park, Jaewon Chu, Hyunwoo J. Kim
When Better Turns Do Not Make Better Agents: Diagnosing the Gap Between Next-Turn Metrics and Workflow Success
Md Tahmid Rahman Laskar, Xue-Yong Fu, Gundeep Singh, Karol Chang, Kevin Sanders, Shi Zong, Tania Habib, Julien Bouvier Tremblay, Shayna Gardiner, Harsh Saini, Matthias Lee, Elena Khasanova, Quinten McNamara, Shashi Bhushan Tyamagondlu Nagabhushan
Dynamics-Aware Navigation for Autonomous UI Agents on Directional-Input Devices
Ishitwa Viranchi, Akshintala Nagesh Kashyap, Mrunal Shah
Why Pay for Long Reasoning When Rewrite Do Trick? Causal Effects of Reasoning History Compaction on Future Generation and Agent Cost
Anton Ivanov Hristov
Diversity and Deliberation in Homogeneous LLM Prediction Polls
Jonas Gebele, Tristan Till, Florian Matthes
When Agreement Is Not Enough: Evidence-Risk Arbitration for Multi-Strategy Agentic QA
Yang He, Jinlin Wang, Yulong Ji, Jianwei Zhang
FlexSciEval: Structure-Grounded Multi-agent Evaluation for Flexible Electronics Research
Ke Li, Xinyi Yang, Runzhe Zhan, Qianyong Hu, Derek F. Wong, Qingsong Li, Zhiyuan Liu
What People Almost Did: Evaluating LLM Social Simulations Beyond Behavioral Fit
JaeWon Kim, Angie Boggust
Lost in the Handoff: Contract-Aware Compliance Checking for Multi-Agent LLM Systems
Yang He, Jinlin Wang, Yulong Ji, Jianwei Zhang
SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale
Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan Tyamagondlu Nagabhushan
D-Mem: A Dual-Process Memory System for LLM Agents
Zhixing You, Jiachen Yuan, Jason Cai
VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation
Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu
CoDA-NAS: Pattern Knowledge-Based Cross-Task Neural Architecture Search with LLM Agents
Hao-Qun Huang, Kai-Chun Wu, Hsin-Yu Wang, Chun-Wei Tsai
Disentangling Topology and Diversity in Multi-Agent LLMs for Multilingual Low-Resource Emotion Detection
Ulugbek Shernazarov, Charitha Ruwansiri Weerakon Basnayake, Abdelkhaleq EL JARJINI, Noel Crespi, Praboda Rajapaksha
Teaching Coding Assistants What to Change: Fine-Tuning from Pairwise Preferences
HONGMO TAO, Hiroyuki Kamata
Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim
Prompting Strategies for Conceptual Ideation in Problem Solving
Chris Bates, Ian Perera
Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error
Hongliu Cao
ToolFuse: Documentation-Intent Fusion for Training-Free Tool Retrieval
Shao-Cheng Lu, Shui-Hsiang Hsu, Chen-Jui Yu, Yao-Chung Fan
Trace2Ground: Scenario, Disambiguation, and Relation Traces for Web GUI Grounding
Ruozhen He, Zhongnan Qu, Sheng Zhang, Mesut Erhan Unal, Zhuowen Tu, srikar appalaraju, Jianbo Yuan, Shabnam Ghadar, Haofu Liao
Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents
Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, wei jiang, Yong Li
CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval
Vaishali Senthil, Ashutosh Hathidara, Sebastian Schreiber
MATEO: A Multimodal Benchmark for Planning with Temporal Execution Ordering
Gabriel Roccabruna, Olha Khomyn, giuseppe riccardi
Rethinking Agentic Search with RELEX: Is Lexical Retrieval Sufficient?
Tz-Huan Hsu, Jheng-Hong Yang, Yijun Ge, Jimmy Lin
Whose Repair? A Multi-Loop Diagnostic of Interactive Alignment in Human–LLM Conversation
Wanqing Psyche He, Midam Kim
Non-archival (48 papers)
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen
A Single-GPU Recipe for Specification-Grounded Industrial Decision Support
Zixiang Xu, linna yu, miao xie
When Context Sharing Looks Better Than It Is: Evaluation Pitfalls in Multi-Agent Question Answering
Jiameng Zhang
RMA: an Agentic System for Research-Level Mathematical Problems
Zelin Zhao, Bo Yuan, Yuchen Zhu, Jaemoo Choi, Yongxin Chen
Distance from Equilibrium Is Not the Same as Loss from Equilibrium: A Colonel Blotto Study of LLM Persona Behavior
deli liu, Xiaoping Zhou, Yu Li
Reads Are Not Free: Read-Budget-Aware Retrieval and Agent-as-Router for LLM Agents
Peter Choi
FounderBench: Evaluating LLM Agents on Sequential Startup Decisions
Yufeng Wang
Agentic AutoRAG: RAG Pipeline Optimization through Reasoning-Driven Agents
Lasse B. Strand, Robert Jakob, Kevin O'Sullivan, Markus Kreft
A Causal Safety Lifecycle for Self-Improving Agents
Mohammad Taha Bahadori, Victor Quintas, Patrick Blöbaum, Badre Narayanan Vedantha Ramanujan, David Heckerman
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi
SkillAtlas: An Attack Trace Library for Agent Skills
Yuxin Tian, Zenghao Duan, Liang Pang, Zhiyi yin, Xueqi Cheng
EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises
Harsh Vishwakarma, Ankush Agarwal, Suraj Mahadev Nagaje, Chaitanya Devaguptapu
VeriEvolve: Evaluator-First Evolution for Tool-Using Agents
Yueshen Li, Kamer Ali Yuksel, Gokhan Tur, Dilek Hakkani-Tür, João Pedro Maia, Hassan Sawaf
Fidelity Collapses with Table Size, Not Turn Count: Delivery Architecture in a Deployed Tool-Using Agent
Tung Thanh Hoang
What Does Better Retrieval Buy Coding Agents? A Cross-Level Study of Retrieval, Context Acquisition, and Issue Resolution
Jingzhuo Hu, Aakash Suresh, Zhifei Li, Hanchen Li, Yichuan Wang
ALFWorld-Para: Simple Object Renaming Reveals the Fragility of RL-Trained LLM Agents
Chanyoung Kim, Harim Song, Keonyoung Lee, Dahuin Jung
Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools
Bardia Mohammadi, Lars Henning Klein, Akhil Arora, Laurent Bindschaedler
When to Cross the Rubicon: Settlement Reliability for LLM Agent Tool Use
Bardia Mohammadi, Lars Henning Klein, Akhil Arora, Laurent Bindschaedler
Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit
Jingxi Wei
Cross-Modal Tool Chaining in a Deployed Agentic Retrieval System
Arnau Rodon Comas
Agentic Proving for Program Verification
Alessandro Sosso, Akhil Arora, Bas Spitters
QuoteBench: When Matched Scores Hide Command-Path Failures
Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
ErosionBench: Probing Alignment Decay in Enterprise Multi-Agent Systems
Riya Bharathwaj, Akshara Prabhakar, Roshan Ram, Avni Kothari, Sarah Tan, Huan Wang, Silvio Savarese
Is Language the Barrier? Web Agents and Judges on the Real Multilingual Web
Imene Kerboua, Véronique Eglin, Alex Aussem, Jérémy Espinas, Louis Airale
Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents
Jiaming Wei, Zekun Wu, Adriano Koshiyama, Maria Perez-Ortiz
Localizing LLM Failures in Decision Making with Bayesian Optimal Baselines
Joeun Yook, Terry Jingchen Zhang, Zhijing Jin
Auto-Adapter: Physics-in-the-Loop Robot Driver Synthesis for Embodied LLM Agents
Yifan Wang, Zekun Wu, Kleyton Da Costa, Clara Crommen, Hana Emma Hadidi, Philip Colin Treleaven, Adriano Koshiyama
Efficient Benchmarking in Production: A Study of an Evolving LLM Agent
Yining She, Lei Lin
When Evidence-Use Gains Do Not Transfer to Evidence Seeking
Ziqian Wang, Jinli Suo
Data-Driven Persona-Conditioned Agents for A/B Test Simulation
Ziyad Benomar, Weronika Łajewska, Leonardo Perelli, Saab Mansour
A Reproducible and Verifiable Framework for Evaluating Omni-Modal Tool Calling LLM Agents
Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan Tyamagondlu Nagabhushan
LLM Graders Are Systematically Harsher Than Industry Interviewers: A Benchmark of 221 Real Technical Interviews
Parth Agarwal, Sanchit Bahuguna, Dhruv Kumar
CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
Parth Agarwal, DHRUV SHAH, Navya Kommuri, Prisha Singhal, Trizal Garg, VAIBHAV DEVRAJ, Jagat Sesh Challa, Yash Sinha, Dhruv Kumar
The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent Operating Systems
Bardia Mohammadi, Laurent Bindschaedler
Stage-Level Attribution for Browser Agents under Label–Destination Attacks
Usukhbayar Purevdorj, Zekun Wu, Adriano Koshiyama, Philip Colin Treleaven
Retrieval-Augmented LLM Agents: Learning to Learn from Experience
Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant
Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents
Nicholas Edwards, Sebastian Schuster
CANVAS: Continuity-Aware Narrative Generation via Visual Agentic Storyboarding
Ishani Mondal
DIVERGE: Diversity-Enhanced Retrieval-Augmented Generation for Open-Ended Information Seeking
Tianyi Hu, Niket Tandon, Akhil Arora
Agent-Environment Alignment via Automated Interface Generation
Kaiming Liu, Xuanyu Lei, Ziyue Wang, Peng Li, Yang Liu
MemGround: Evaluating Memory Behavior of Large Language Models in Long-Horizon Gamified Scenarios
Yiting Zhao, Wanke Xia, Yihang Ding, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang
TRIAGE: Severity-Ranked Multi-Agent Failure Attribution
Xizhi Wang
Quantifying Self-Preservation Bias in Large Language Models
Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso
Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users
Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani
Robust Semantic Steganography with Large Language Models
Chihsheng Jin, William Jurayj, William Gantt Walden
Data-Driven Personas for Survey Simulation: Insights into Simulation Alignment Across Data-Access Regimes
Dongryeol Lee, Weronika Łajewska, Leonardo Perelli, Saab Mansour
Wiki-Talkie: Multilingual Benchmarking of Persona-Based Agents on Real-World Discussions
Dennis Fucci, Andrea Bacciu, Dong Liu, Weronika Łajewska, Saab Mansour
DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain
Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou