Accepted Papers
We accepted 163 papers in total: 6 oral papers (top 2%), 9 spotlight papers (top 6%), and 148 poster papers. Among the accepted papers, 55 were non-archival and 108 were archival.
Oral Papers
| Causal Decomposition of LLM Agent Failure via Oracle-State Intervention Leqi Jia, Muhammad Saadat, Marlin Wong, Adithya Venkatesh, Kiran Nijjer (archival) |
| Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier (non-archival) |
| STAC: When Innocent Tools Form Dangerous Chains for LLM Agents Jing-Jing Li, Jianfeng He, Chao Shang, Devang Kulshreshtha, Xun Xian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi (archival) |
| CAPSafe: A Benchmark for Contextual Action and Plan Safety Reasoning in Embodied Agents Youmna Farag, Svetlana Stoyanchev, Simon Keizer, Mohan Li, Rama Doddipatla (archival) |
| Agents Repair — or Just Reply? Public Correction in Deployed Agent Forums Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan (non-archival) |
| The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks Bardia Mohammadi, Lars Henning Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler (non-archival) |
Spotlight Papers
| From Textbooks to Proactive Agentic Systems: Scaling Long-Horizon Planning via Automated Agentic System Construction Mohamed Khelifi, Saif Daoud, Leena Babiker, Sami Ouanes, Mohammad Raza, Safa Messaoud (non-archival) |
| Capture Is Easy, Forgetting Is Hard: Benchmarking Prospective Memory in Conversational Agents Deniz Bilgin, Jonas Schewior, Andreas Wendemuth (archival) |
| Research Agents Feed Doubts, Not Beliefs: Auditing Belief Framing in Live-Web Search Siddharth Vohra, Min Xu (archival) |
| Source Is Not Authority: Selector-Aware Provenance Authorization for Tool-Using Agents Vedant Singh (non-archival) |
| ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Henning Klein, Akhil Arora (non-archival) |
| Failing Agents Leave Traces: Telemetry Signatures for Multi-Tier Agent Evaluation Muthaheera Yasmeena Belgur Shamiullah (archival) |
| SEDIMA: Cross-Run Hierarchical Insight Memory for Evolutionary Search Agents Amirhossein Abaskohi, Mahdi Mostajabdaveh, Zirui Zhou (archival) |
| CANDID: Candidate-Driven Intervention for Disciplined Execution in Local Computer-Use Agents Woongkyu Lee, Jungwook Choi (non-archival) |
| CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation Yang Wu, Stefano Petrangeli, Ishita Dasgupta, Yu Shen (archival) |
Posters
Archival (100 papers)
| Shared Selective Persistent Memory for Agentic LLM Systems Sanjana Pedada, Aditya Dhavala, Neelraj J. Patil |
| Hydra: Adaptive Adversarial Attacks for Dynamic Multi-Stage Edge Intelligence Services Linhan Li, Chuanqi Jiang, Wenqian Weng, Jacqueline J. Pang, Zhiguo Tao |
| Silent Locale Corruption: Diagnosing and Mitigating Chinese-Locale Semantic Failures in LLM Tool Calling Ruiyang Zhang |
| Self-Correcting Large Language Models: Generation vs. Multiple Choice Hossein A. Rahmani, Satyapriya Krishna, Xi Wang, Mohammadmehdi Naghiaei, Emine Yilmaz |
| Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories Prakhar Khatri |
| Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation Lijuan Tang, Yuemeng Zheng |
| When Is Agent Tool-Result Cache Reuse Actually Safe? Liang Nie, Hehua Zhang |
| Authentic but Not Neutral: Selective Evidence in LLM-Agent Leaderboards Xiaoxuan Li, Bangbang Liu, Ying Zhao |
| GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI Arunabh Srivastava, Mohammad A. Khojastepour, Srimat Chakradhar, Sennur Ulukus |
| Answer or Compute? Direct Inference vs. Code Generation for LLM Game-State Understanding in RTS Games Chang Liu |
| Foundation First: Stabilizing SLM Agents via Pre-execution Logical Scaffolding Juntae Lee, Jihwan Bang, Seunghan Yang, Sungha Choi |
| Agent Step Value: Auditing Evaluation-Channel Sensitivity in Black-Box Agent Traces Andrew Zhang, Chengzhan Li |
| PRISM: Bounded Autonomy for LLM Agents via Workflow Projection and Deterministic Consequence Boundaries Prasannjeet Singh |
| FUSE: Failure-Guided Scenario Synthesis and Weighted Refinement for LLM Function Calling Zhiguo Tao, Linhan Li, Lifan Sun, Zichen Yuan |
| Is Progressive Disclosure All You Need for Long-Context Agents? Yifeng He, Yinzhe Zhao, Jicheng Wang, Hao Chen |
| From Credit Assignment to Repair: A Leakage-Controlled Diagnostic Study of Tool-Using Agents SHAOBO QIAO |
| When Should LLM Agents Forget? Memory Filtering Under Query-Critical Resolver Errors Samarth Vinayaka |
| Do Query-Agnostic Memory Structures Earn Their Budget? A 10M-Token Audit with Exact Read Limits Amit Maraj, Kannav Sethi |
| Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification Yihang Chen, Pin Qian, Su Wang, Chong Peng, Huan Xu, Shuaiting Li, Yiqi Sun |
| Retrieval is Enough: A Memory-Augmented Agent for Algorithm Selection Zhang Weizhou, Lixing Lyu |
| Decomposing Self-Reflection in LLM Agents: Diagnostic Scaffolds, Uncertainty Labels, and Action Diversity Poli Nemkova, Haeshitha Indukuri |
| Agent-Readiness of Synthesized API Tools: Parametric Gravity and the Limits of Documentation Grounding Teodora Stereciu, Baohao Liao, Christian Herold, Shahram Khadivi, Christof Monz |
| Where the Tokens Go: A Measured Anatomy of LLM Agent Trajectory Costs Tommy Tran |
| Feedback Blindness: Diagnosing Silent Failures in Closed-Loop Agentic Data-Generation Pipelines Loc Nguyen, Nguyen Khanh Long, Vu Gia Nam, Nguyen Tran Minh Nhat |
| Tool Quality, Not Framework Complexity: Evaluating RLM Vision, Code, and Memory Pipelines for Radiology Applications Jonas Schewior, Ansari Hamid Raja Gulam, Mohamed Ashfaq Anwerdeen, Andreas Wendemuth |
| Autonomous Event Driven Multi-Agent Orchestration for Enterprise AI at Scale Harsh Rao Dhanyamraju, Leonidas Raghav, Aaron Lee |
| ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems Rista Baral, Akshey Sigdel |
| Same Answers, Different Active-Store States: An Identification Audit of FactConsolidation Single-Hop Daeun Jeong, Yongjun Zhu |
| Externalizing Requirement-to-Repair Artifacts as Observable Traces for LLM-Based Program Repair Zewen Tao, Shin-nosuke Ishikawa |
| Flight to Mediocrity: Why LLM Agent Selectors Under-Hire Experts When Quality Claims Are Unverified Soham Wasmatkar |
| Translating the Translator: Decomposing the Cost of English-Forced Inter-Agent Communication Kushagra Agrawal, Yuming Feng, Man-Fai Leung |
| Mo’ Models, Mo’ Problems: How to best select model pools when designing Multi-Agent Systems Sara Vera Marjanovic, Jiacheng Xu, Aleksandr Laptev, Grigor Nalbandyan, Erik Arakelyan, Evelina Bakhturina |
| Be Careful Who You Trust: Coordination Dynamics under Corrupted Communication in LLM Multi-Agent Games Xuanyi Liu, Niall Dalton, Hairi Amin, Xiyuan Yin, Lydia Lim |
| Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents Quang Dao, Purvi Kathalkar, Kenneth Eaton |
| ACIES: A Self-Evolving Agentic Contract-Based Framework for Cyber-Physical System Control Synthesis Yifeng Xiao, Zhiyu Ni, Dinghong Song, Mi Zhou, Pierluigi Nuzzo |
| Capability Is Not Complementarity: A Routing Feasibility Study in Financial Question Answering Rishi N. Simhadri |
| Generation and Verification: Human-Agent Collaboration for Safety-Critical Automotive Software Engineering Elizaveta Zinovyeva, Aiham Taleb, Nikita Kozodoi, Daniel Schleicher, Amir Mahdi Namazi, Martin Kraus, Levent Kent, Brian Jensen |
| Two Thirds of the Best-of-K Oracle Band in Tool Agents Is Unreachable by Reward-Free Selection Srinivas Harish |
| AIDG: A Formal Decomposition of Information Extraction and Containment Asymmetries in Multi-Turn LLM Dialogue Adib Sakhawat, Fardeen Sadab, Rakin Shahriar |
| V-RAM: A Visual Retrieval-Augmented Multi-Agent Reasoning Framework for Medical Dialogue Diagnosis Shukraditya Bose, Soumen Sinha, Ananya R Bhat, Rahul Roy |
| AgenticLOCI: A Multi-Agent Memory Framework for Conversational AI with Longitudinal Personalization Jonas Schewior, Deniz Bilgin, Gonzalo Haefner, Andreas Wendemuth |
| When Hiring Becomes Agent-Mediated: Evaluating Access and Recurrence in Two-Agent Résumé Screening Jian Gao, Hang Jiang |
| When Failures Propagate: Causal Failure Attribution in Agentic Retrieval-Augmented Generation Lauren Pothuru |
| What Agent Benchmarks Don't Tell You: Recoverability and Credit Assignment in Agentic Retrieval Evaluation Sai Krishna Rallabandi, Parag Pravin Dakle, Preethi Raghavan |
| When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Kumar Porwal, Honey Gupta |
| Beating a Random-Direction Bank Does Not Establish Policy Improvement: An Exact-Value Audit of Activation Steering for Agents Avinash Goutham Aluguvelly |
| DySAS: Dynamic State-Aware Student Simulation Beyond Static Personas Partha Sarathi Purkayastha, Heejin Do |
| MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use Zixiang Liu, Wenrui Liu, Elsie Dai, Wenhan Yu, Lei Yu, Tong Yang, Yinjun Han, Hong Gao |
| Grounding First: Auditing a Structured Recovery Wrapper for Local Open-Weight Reflexion Agents Nimay Ballal, BADRI PRASAD V R |
| What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Framework Ioannis Prokopiou, Athanasios Aidinis, Panagiotis-Christos Kyrmpatsos, Pantelis Vikatos |
| Runtime Verification of Dimensional Semantics in Checkpointed Large Language Model Tool Workflows Aditya Mazumdar |
| Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents Hafsa Akbar, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama, Alex Pentland |
| EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-Scale Multi-Agent Systems Shuang Xie, Yunan Lu, Han Li, Lingyun Wang |
| ExGQL: Self-Improving Natural Language-to-Graph Query Generation via Experience-Guided Learning Penghong Guo, Boxin Du, Houliang Zhou, Chaman Gupta, Yina Gu, Rayssa Küllian, Shen Jiang |
| Environment Steering: Using Data Flow Control to Improve Agent Utility and Safety Charlie Summers, Prajwal Raghunath, Aaditya Pai, Mayur Kulkarni, Zhuo Zhang, Oliver Kennedy, Eugene Wu |
| Role-Diverse Agent Forests for Neuroimaging Triage: When Does Prompt-Induced Role Diversity Help? Tamara Kostova, Sonja Gievska |
| The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits Siddharth Vohra, Manikandan Ravikiran |
| When Critics Go Stale: Benchmarking Safety Guardrail Degradation Under Environment Drift Fatemeh Taheri Dezaki, Lakshman Kolasani, Ankita Bhaumik, Siddartha Sathyamoorthy Rao, Ayush Jain |
| Are LLM Shopping Agents Behaviorally Distinguishable from Human Shoppers? A Session-Level Study Arka Dutta, Virinchi Roy Surabhi, Jiayue Tong, Dihan Dai, Olcay Boz, Amila Weerasinghe |
| BioSciReview-Bench: Benchmarking Coding Agents on Silent Scientific Bug Detection in Bioinformatics Code Junhao Qiu |
| Do Tool Schemas Fully Specify Argument Binding? Jai Kumar Sharma, Peeyush Tapadiya |
| Testing Behavioral Adaptation in Repeated Interactions Between LLM Agents Lixin Liu, Yixuan Li, Xiankun Lin, Yutian Lu, Shiguang NI |
| CaseInterviewBench: Evaluating Agentic AI's Purpose-Reflective Autonomy to Uncover What the User Really Needs Shin-nosuke Ishikawa, Masato Todo, Atsushi Yoshino, Hirotsugu OHBA |
| A Case Study of On-Premise ReAct for Collaborative Robot Programming Yu-Seung Ma, Sangyeop Yeo |
| Causal Episodic Memory for Feedback-Driven Agent Repair Khang Nhat Hoang Vo, Tam Minh, Anh Trac Duc Dinh, Thuyen Vinh Ha Bui, Tho Quan |
| Chronicle: Cut-Point Replay for Regression Testing of LLM Agents Tisha Chawla, Susheem Koul |
| Contract Before Code: Failure-Compiled Contracts for Long-Horizon Coding Agents Jiangnan YU, Kisson Songqi Lin |
| DeepRewind: Predicting and Repairing Premature Commitments in Deep Research Agents Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Lele Wang, Peter West, Giuseppe Carenini |
| BirdsongChat: A Hybrid Multi-Agent Framework for Interactive Multimodal Embodied Behavior Simulation Callie C. Liao, Duoduo Liao, Ellie L. Zhang |
| An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios Hankyul Baek, Jaewon Noh, Sang Seo, Yongsu Kim, Gabriel Waikin Loh Matienzo, Young Il Kim, Ee Wei Seah, Akriti Vij |
| GLOBE: Evolving Structured Agentic Memory for E-commerce Product Optimization in Generative Search Hyunseo Kim, Suil Choe, Sukkyoung So, Daeyeon Yi |
| COMPASS: Critique-guided Optimization of MetaPolicies for Agentic Systems with Reinforcement Learning Krishna Sayana, Ketan Kumar Todi, Ambarish Jash, Sukhdeep Sodhi |
| From Trajectories to Workflows: Online Procedural Memory Abstraction for Language Agents Swathi Shree Narashiman, Ishan Jindal, Mahesh Chandran |
| Prior-History Sensitivity in Agentic Safety Evaluations Melat Ghebreselassie, Melissa Li |
| CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents Wuya Chen, Yihao yang, Yang Cao, Yue Lin |
| SkillCombiner: Optimizing Agent Skills via Edit Combination Search Seungbeom Park, Jaewon Chu, Hyunwoo J. Kim |
| When Better Turns Do Not Make Better Agents: Diagnosing the Gap Between Next-Turn Metrics and Workflow Success Md Tahmid Rahman Laskar, Xue-Yong Fu, Gundeep Singh, Karol Chang, Kevin Sanders, Shi Zong, Tania Habib, Julien Bouvier Tremblay, Shayna Gardiner, Harsh Saini, Matthias Lee, Elena Khasanova, Quinten McNamara, Shashi Bhushan Tyamagondlu Nagabhushan |
| Dynamics-Aware Navigation for Autonomous UI Agents on Directional-Input Devices Ishitwa Viranchi, Akshintala Nagesh Kashyap, Mrunal Shah |
| Why Pay for Long Reasoning When Rewrite Do Trick? Causal Effects of Reasoning History Compaction on Future Generation and Agent Cost Anton Ivanov Hristov |
| Diversity and Deliberation in Homogeneous LLM Prediction Polls Jonas Gebele, Tristan Till, Florian Matthes |
| When Agreement Is Not Enough: Evidence-Risk Arbitration for Multi-Strategy Agentic QA Yang He, Jinlin Wang, Yulong Ji, Jianwei Zhang |
| FlexSciEval: Structure-Grounded Multi-agent Evaluation for Flexible Electronics Research Ke Li, Xinyi Yang, Runzhe Zhan, Qianyong Hu, Derek F. Wong, Qingsong Li, Zhiyuan Liu |
| What People Almost Did: Evaluating LLM Social Simulations Beyond Behavioral Fit JaeWon Kim, Angie Boggust |
| Lost in the Handoff: Contract-Aware Compliance Checking for Multi-Agent LLM Systems Yang He, Jinlin Wang, Yulong Ji, Jianwei Zhang |
| SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale Md Tahmid Rahman Laskar, Xue-Yong Fu, Shashi Bhushan Tyamagondlu Nagabhushan |
| D-Mem: A Dual-Process Memory System for LLM Agents Zhixing You, Jiachen Yuan, Jason Cai |
| VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu |
| CoDA-NAS: Pattern Knowledge-Based Cross-Task Neural Architecture Search with LLM Agents Hao-Qun Huang, Kai-Chun Wu, Hsin-Yu Wang, Chun-Wei Tsai |
| Disentangling Topology and Diversity in Multi-Agent LLMs for Multilingual Low-Resource Emotion Detection Ulugbek Shernazarov, Charitha Ruwansiri Weerakon Basnayake, Abdelkhaleq EL JARJINI, Noel Crespi, Praboda Rajapaksha |
| Teaching Coding Assistants What to Change: Fine-Tuning from Pairwise Preferences HONGMO TAO, Hiroyuki Kamata |
| Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim |
| Prompting Strategies for Conceptual Ideation in Problem Solving Chris Bates, Ian Perera |
| Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error Hongliu Cao |
| ToolFuse: Documentation-Intent Fusion for Training-Free Tool Retrieval Shao-Cheng Lu, Shui-Hsiang Hsu, Chen-Jui Yu, Yao-Chung Fan |
| Trace2Ground: Scenario, Disambiguation, and Relation Traces for Web GUI Grounding Ruozhen He, Zhongnan Qu, Sheng Zhang, Mesut Erhan Unal, Zhuowen Tu, srikar appalaraju, Jianbo Yuan, Shabnam Ghadar, Haofu Liao |
| Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, wei jiang, Yong Li |
| CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval Vaishali Senthil, Ashutosh Hathidara, Sebastian Schreiber |
| MATEO: A Multimodal Benchmark for Planning with Temporal Execution Ordering Gabriel Roccabruna, Olha Khomyn, giuseppe riccardi |
| Rethinking Agentic Search with RELEX: Is Lexical Retrieval Sufficient? Tz-Huan Hsu, Jheng-Hong Yang, Yijun Ge, Jimmy Lin |
| Whose Repair? A Multi-Loop Diagnostic of Interactive Alignment in Human–LLM Conversation Wanqing Psyche He, Midam Kim |
Non-archival (48 papers)
| OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen |
| A Single-GPU Recipe for Specification-Grounded Industrial Decision Support Zixiang Xu, linna yu, miao xie |
| When Context Sharing Looks Better Than It Is: Evaluation Pitfalls in Multi-Agent Question Answering Jiameng Zhang |
| RMA: an Agentic System for Research-Level Mathematical Problems Zelin Zhao, Bo Yuan, Yuchen Zhu, Jaemoo Choi, Yongxin Chen |
| Distance from Equilibrium Is Not the Same as Loss from Equilibrium: A Colonel Blotto Study of LLM Persona Behavior deli liu, Xiaoping Zhou, Yu Li |
| Reads Are Not Free: Read-Budget-Aware Retrieval and Agent-as-Router for LLM Agents Peter Choi |
| FounderBench: Evaluating LLM Agents on Sequential Startup Decisions Yufeng Wang |
| Agentic AutoRAG: RAG Pipeline Optimization through Reasoning-Driven Agents Lasse B. Strand, Robert Jakob, Kevin O'Sullivan, Markus Kreft |
| A Causal Safety Lifecycle for Self-Improving Agents Mohammad Taha Bahadori, Victor Quintas, Patrick Blöbaum, Badre Narayanan Vedantha Ramanujan, David Heckerman |
| APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi |
| SkillAtlas: An Attack Trace Library for Agent Skills Yuxin Tian, Zenghao Duan, Liang Pang, Zhiyi yin, Xueqi Cheng |
| EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises Harsh Vishwakarma, Ankush Agarwal, Suraj Mahadev Nagaje, Chaitanya Devaguptapu |
| VeriEvolve: Evaluator-First Evolution for Tool-Using Agents Yueshen Li, Kamer Ali Yuksel, Gokhan Tur, Dilek Hakkani-Tür, João Pedro Maia, Hassan Sawaf |
| Fidelity Collapses with Table Size, Not Turn Count: Delivery Architecture in a Deployed Tool-Using Agent Tung Thanh Hoang |
| What Does Better Retrieval Buy Coding Agents? A Cross-Level Study of Retrieval, Context Acquisition, and Issue Resolution Jingzhuo Hu, Aakash Suresh, Zhifei Li, Hanchen Li, Yichuan Wang |
| ALFWorld-Para: Simple Object Renaming Reveals the Fragility of RL-Trained LLM Agents Chanyoung Kim, Harim Song, Keonyoung Lee, Dahuin Jung |
| Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools Bardia Mohammadi, Lars Henning Klein, Akhil Arora, Laurent Bindschaedler |
| When to Cross the Rubicon: Settlement Reliability for LLM Agent Tool Use Bardia Mohammadi, Lars Henning Klein, Akhil Arora, Laurent Bindschaedler |
| Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit Jingxi Wei |
| Cross-Modal Tool Chaining in a Deployed Agentic Retrieval System Arnau Rodon Comas |
| Agentic Proving for Program Verification Alessandro Sosso, Akhil Arora, Bas Spitters |
| QuoteBench: When Matched Scores Hide Command-Path Failures Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang |
| ErosionBench: Probing Alignment Decay in Enterprise Multi-Agent Systems Riya Bharathwaj, Akshara Prabhakar, Roshan Ram, Avni Kothari, Sarah Tan, Huan Wang, Silvio Savarese |
| Is Language the Barrier? Web Agents and Judges on the Real Multilingual Web Imene Kerboua, Véronique Eglin, Alex Aussem, Jérémy Espinas, Louis Airale |
| Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents Jiaming Wei, Zekun Wu, Adriano Koshiyama, Maria Perez-Ortiz |
| Localizing LLM Failures in Decision Making with Bayesian Optimal Baselines Joeun Yook, Terry Jingchen Zhang, Zhijing Jin |
| Auto-Adapter: Physics-in-the-Loop Robot Driver Synthesis for Embodied LLM Agents Yifan Wang, Zekun Wu, Kleyton Da Costa, Clara Crommen, Hana Emma Hadidi, Philip Colin Treleaven, Adriano Koshiyama |
| Efficient Benchmarking in Production: A Study of an Evolving LLM Agent Yining She, Lei Lin |
| When Evidence-Use Gains Do Not Transfer to Evidence Seeking Ziqian Wang, Jinli Suo |
| Data-Driven Persona-Conditioned Agents for A/B Test Simulation Ziyad Benomar, Weronika Łajewska, Leonardo Perelli, Saab Mansour |
| A Reproducible and Verifiable Framework for Evaluating Omni-Modal Tool Calling LLM Agents Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan Tyamagondlu Nagabhushan |
| LLM Graders Are Systematically Harsher Than Industry Interviewers: A Benchmark of 221 Real Technical Interviews Parth Agarwal, Sanchit Bahuguna, Dhruv Kumar |
| CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics Parth Agarwal, DHRUV SHAH, Navya Kommuri, Prisha Singhal, Trizal Garg, VAIBHAV DEVRAJ, Jagat Sesh Challa, Yash Sinha, Dhruv Kumar |
| The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent Operating Systems Bardia Mohammadi, Laurent Bindschaedler |
| Stage-Level Attribution for Browser Agents under Label–Destination Attacks Usukhbayar Purevdorj, Zekun Wu, Adriano Koshiyama, Philip Colin Treleaven |
| Retrieval-Augmented LLM Agents: Learning to Learn from Experience Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant |
| Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents Nicholas Edwards, Sebastian Schuster |
| CANVAS: Continuity-Aware Narrative Generation via Visual Agentic Storyboarding Ishani Mondal |
| DIVERGE: Diversity-Enhanced Retrieval-Augmented Generation for Open-Ended Information Seeking Tianyi Hu, Niket Tandon, Akhil Arora |
| Agent-Environment Alignment via Automated Interface Generation Kaiming Liu, Xuanyu Lei, Ziyue Wang, Peng Li, Yang Liu |
| MemGround: Evaluating Memory Behavior of Large Language Models in Long-Horizon Gamified Scenarios Yiting Zhao, Wanke Xia, Yihang Ding, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang |
| TRIAGE: Severity-Ranked Multi-Agent Failure Attribution Xizhi Wang |
| Quantifying Self-Preservation Bias in Large Language Models Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso |
| Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani |
| Robust Semantic Steganography with Large Language Models Chihsheng Jin, William Jurayj, William Gantt Walden |
| Data-Driven Personas for Survey Simulation: Insights into Simulation Alignment Across Data-Access Regimes Dongryeol Lee, Weronika Łajewska, Leonardo Perelli, Saab Mansour |
| Wiki-Talkie: Multilingual Benchmarking of Persona-Based Agents on Real-World Discussions Dennis Fucci, Andrea Bacciu, Dong Liu, Weronika Łajewska, Saab Mansour |
| DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou |