{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:GDMHP6XARS7BXZKKHEBKRIK7M5","short_pith_number":"pith:GDMHP6XA","schema_version":"1.0","canonical_sha256":"30d877fae08cbe1be54a3902a8a15f67566db1d9907144b3a0cf79f178865de6","source":{"kind":"arxiv","id":"2407.18901","version":1},"attestation_state":"computed","paper":{"title":"AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.SE","authors_text":"Ashish Sabharwal, Edward Li, Harsh Trivedi, Mareike Hartmann, Niranjan Balasubramanian, Ruskin Manku, Shashank Gupta, Tushar Khot, Vinty Dong","submitted_at":"2024-07-26T17:55:45Z","abstract_excerpt":"Autonomous agents that address day-to-day digital tasks (e.g., ordering groceries for a household), must not only operate multiple apps (e.g., notes, messaging, shopping app) via APIs, but also generate rich code with complex control flow in an iterative manner based on their interaction with the environment. However, existing benchmarks for tool use are inadequate, as they only cover tasks that require a simple sequence of API calls.\n  To remedy this gap, we built $\\textbf{AppWorld Engine}$, a high-quality execution environment (60K lines of code) of 9 day-to-day apps operable via 457 APIs an"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.18901","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2024-07-26T17:55:45Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"ae77e3b4fe1e1b7cc7f613eb97ba22463cecbc6f91613e5b7cdd6b161978500d","abstract_canon_sha256":"e69a0c6895ccbe0c087476c359126d5d4373927955078852f432870dcbcd368c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:48:56.156699Z","signature_b64":"u42qC77IUg3Khfna8rK7Va5Ft453T/kMjunry4+Z5EL8v7FtYEIikRP6jgyWUI27bdRrqKqBXIgldL5PX4h1AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"30d877fae08cbe1be54a3902a8a15f67566db1d9907144b3a0cf79f178865de6","last_reissued_at":"2026-07-05T08:48:56.156204Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:48:56.156204Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.SE","authors_text":"Ashish Sabharwal, Edward Li, Harsh Trivedi, Mareike Hartmann, Niranjan Balasubramanian, Ruskin Manku, Shashank Gupta, Tushar Khot, Vinty Dong","submitted_at":"2024-07-26T17:55:45Z","abstract_excerpt":"Autonomous agents that address day-to-day digital tasks (e.g., ordering groceries for a household), must not only operate multiple apps (e.g., notes, messaging, shopping app) via APIs, but also generate rich code with complex control flow in an iterative manner based on their interaction with the environment. However, existing benchmarks for tool use are inadequate, as they only cover tasks that require a simple sequence of API calls.\n  To remedy this gap, we built $\\textbf{AppWorld Engine}$, a high-quality execution environment (60K lines of code) of 9 day-to-day apps operable via 457 APIs an"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.18901","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.18901/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.18901","created_at":"2026-07-05T08:48:56.156264+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.18901v1","created_at":"2026-07-05T08:48:56.156264+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.18901","created_at":"2026-07-05T08:48:56.156264+00:00"},{"alias_kind":"pith_short_12","alias_value":"GDMHP6XARS7B","created_at":"2026-07-05T08:48:56.156264+00:00"},{"alias_kind":"pith_short_16","alias_value":"GDMHP6XARS7BXZKK","created_at":"2026-07-05T08:48:56.156264+00:00"},{"alias_kind":"pith_short_8","alias_value":"GDMHP6XA","created_at":"2026-07-05T08:48:56.156264+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":35,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24151","citing_title":"Metis: Bridging Text and Code Memory for Self-Evolving Agents","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22385","citing_title":"MetaPS: Adaptive Programmatic Strategy Selection for Market Agents","ref_index":94,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22000","citing_title":"CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12908","citing_title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12634","citing_title":"Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10813","citing_title":"RedAct: Redacting Agent Capability Traces for Procedural Skill Protection","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05414","citing_title":"When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05080","citing_title":"AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03854","citing_title":"CLI-Anything: Towards Agent-Native Computer Use","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02355","citing_title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02113","citing_title":"A Primer in Post-Training Reasoning Data: What We Know About How It Works","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08717","citing_title":"Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12634","citing_title":"Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30383","citing_title":"Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29537","citing_title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28158","citing_title":"OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06708","citing_title":"Signal-Driven Observation for Long-Horizon Web Agents","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17573","citing_title":"Cordon: Semantic Transactions for Tool-Using LLM Agents","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16679","citing_title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2509.12626","citing_title":"DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2601.11100","citing_title":"ReCreate: Reasoning and Creating Domain Agents Driven by Experience","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2601.20144","citing_title":"Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2508.07407","citing_title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2504.19678","citing_title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08588","citing_title":"Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5","json":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5.json","graph_json":"https://pith.science/api/pith-number/GDMHP6XARS7BXZKKHEBKRIK7M5/graph.json","events_json":"https://pith.science/api/pith-number/GDMHP6XARS7BXZKKHEBKRIK7M5/events.json","paper":"https://pith.science/paper/GDMHP6XA"},"agent_actions":{"view_html":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5","download_json":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5.json","view_paper":"https://pith.science/paper/GDMHP6XA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.18901&json=true","fetch_graph":"https://pith.science/api/pith-number/GDMHP6XARS7BXZKKHEBKRIK7M5/graph.json","fetch_events":"https://pith.science/api/pith-number/GDMHP6XARS7BXZKKHEBKRIK7M5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5/action/storage_attestation","attest_author":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5/action/author_attestation","sign_citation":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5/action/citation_signature","submit_replication":"https://pith.science/pith/GDMHP6XARS7BXZKKHEBKRIK7M5/action/replication_record"}},"created_at":"2026-07-05T08:48:56.156264+00:00","updated_at":"2026-07-05T08:48:56.156264+00:00"}