{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:G6USPTWDWIO3IP2XXJ4JRBX3PR","short_pith_number":"pith:G6USPTWD","schema_version":"1.0","canonical_sha256":"37a927cec3b21db43f57ba789886fb7c7bcffa5c0da51696ea213ff47a3061ca","source":{"kind":"arxiv","id":"2507.22034","version":1},"attestation_state":"computed","paper":{"title":"UserBench: An Interactive Gym Environment for User-Centric Agents","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Akshara Prabhakar, Caiming Xiong, Cheng Qian, Haolin Chen, Heng Ji, Huan Wang, Jianguo Zhang, Shelby Heinecke, Silvio Savarese, Weiran Yao, Zhiwei Liu, Zuxin Liu","submitted_at":"2025-07-29T17:34:12Z","abstract_excerpt":"Large Language Models (LLMs)-based agents have made impressive progress in reasoning and tool use, enabling them to solve complex tasks. However, their ability to proactively collaborate with users, especially when goals are vague, evolving, or indirectly expressed, remains underexplored. To address this gap, we introduce UserBench, a user-centric benchmark designed to evaluate agents in multi-turn, preference-driven interactions. UserBench features simulated users who start with underspecified goals and reveal preferences incrementally, requiring agents to proactively clarify intent and make "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.22034","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-07-29T17:34:12Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"8df2018d6948408c6a7ce0752890b5fd1eb1244efa8a5d77e2501485c3e95d9b","abstract_canon_sha256":"db1035174401cbedd48baa2a5629a777682faa3d82ec2424bad58445f0cf734b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:45:11.972682Z","signature_b64":"awkrp7RoFjmOTHXg7+lowxMTvhoKIogjXIhtFlUHhy7ANNcrtGy0SUhF8pu2LWjcV/eO1s4dztLN7rR9fuCzCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"37a927cec3b21db43f57ba789886fb7c7bcffa5c0da51696ea213ff47a3061ca","last_reissued_at":"2026-07-05T11:45:11.972213Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:45:11.972213Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"UserBench: An Interactive Gym Environment for User-Centric Agents","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Akshara Prabhakar, Caiming Xiong, Cheng Qian, Haolin Chen, Heng Ji, Huan Wang, Jianguo Zhang, Shelby Heinecke, Silvio Savarese, Weiran Yao, Zhiwei Liu, Zuxin Liu","submitted_at":"2025-07-29T17:34:12Z","abstract_excerpt":"Large Language Models (LLMs)-based agents have made impressive progress in reasoning and tool use, enabling them to solve complex tasks. However, their ability to proactively collaborate with users, especially when goals are vague, evolving, or indirectly expressed, remains underexplored. To address this gap, we introduce UserBench, a user-centric benchmark designed to evaluate agents in multi-turn, preference-driven interactions. UserBench features simulated users who start with underspecified goals and reveal preferences incrementally, requiring agents to proactively clarify intent and make "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.22034","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.22034/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.22034","created_at":"2026-07-05T11:45:11.972271+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.22034v1","created_at":"2026-07-05T11:45:11.972271+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.22034","created_at":"2026-07-05T11:45:11.972271+00:00"},{"alias_kind":"pith_short_12","alias_value":"G6USPTWDWIO3","created_at":"2026-07-05T11:45:11.972271+00:00"},{"alias_kind":"pith_short_16","alias_value":"G6USPTWDWIO3IP2X","created_at":"2026-07-05T11:45:11.972271+00:00"},{"alias_kind":"pith_short_8","alias_value":"G6USPTWD","created_at":"2026-07-05T11:45:11.972271+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19613","citing_title":"StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12908","citing_title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02908","citing_title":"WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01815","citing_title":"CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27721","citing_title":"UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12191","citing_title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","ref_index":131,"is_internal_anchor":false},{"citing_arxiv_id":"2603.23231","citing_title":"PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09228","citing_title":"ProactBench: Beyond What The User Asked For","ref_index":140,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09408","citing_title":"HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18356","citing_title":"ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17079","citing_title":"Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation","ref_index":2,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR","json":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR.json","graph_json":"https://pith.science/api/pith-number/G6USPTWDWIO3IP2XXJ4JRBX3PR/graph.json","events_json":"https://pith.science/api/pith-number/G6USPTWDWIO3IP2XXJ4JRBX3PR/events.json","paper":"https://pith.science/paper/G6USPTWD"},"agent_actions":{"view_html":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR","download_json":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR.json","view_paper":"https://pith.science/paper/G6USPTWD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.22034&json=true","fetch_graph":"https://pith.science/api/pith-number/G6USPTWDWIO3IP2XXJ4JRBX3PR/graph.json","fetch_events":"https://pith.science/api/pith-number/G6USPTWDWIO3IP2XXJ4JRBX3PR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR/action/storage_attestation","attest_author":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR/action/author_attestation","sign_citation":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR/action/citation_signature","submit_replication":"https://pith.science/pith/G6USPTWDWIO3IP2XXJ4JRBX3PR/action/replication_record"}},"created_at":"2026-07-05T11:45:11.972271+00:00","updated_at":"2026-07-05T11:45:11.972271+00:00"}