{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:JDQUNRBS2JPH7WLKZGPYRMFXD7","short_pith_number":"pith:JDQUNRBS","schema_version":"1.0","canonical_sha256":"48e146c432d25e7fd96ac99f88b0b71fec28c494a5bfd54017c998b9d3567cef","source":{"kind":"arxiv","id":"2403.02502","version":2},"attestation_state":"computed","paper":{"title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Bill Yuchen Lin, Da Yin, Jie Huang, Sujian Li, Xiang Yue, Yifan Song","submitted_at":"2024-03-04T21:50:29Z","abstract_excerpt":"Large Language Models (LLMs) have become integral components in various autonomous agent systems. In this study, we present an exploration-based trajectory optimization approach, referred to as ETO. This learning method is designed to enhance the performance of open LLM agents. Contrary to previous studies that exclusively train on successful expert trajectories, our method allows agents to learn from their exploration failures. This leads to improved performance through an iterative optimization framework. During the exploration phase, the agent interacts with the environment while completing"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.02502","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-03-04T21:50:29Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"19d47eabfde1381f17fb27bd60c0f6cd6d8450ffc5a87cefce2d657239076789","abstract_canon_sha256":"197d544169098d971a027f1edc14de8266e60cd55e391dd78495357a8b6a656a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:42:22.114699Z","signature_b64":"XkkBbwFR4gl06n4WMy5pS4TZW1gv82uZ87qF62apUILc0xFl3EOLeXQZ2ZJMv9xusJNjlaJXLtP6hPRI7D/5Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"48e146c432d25e7fd96ac99f88b0b71fec28c494a5bfd54017c998b9d3567cef","last_reissued_at":"2026-07-05T08:42:22.114211Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:42:22.114211Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Bill Yuchen Lin, Da Yin, Jie Huang, Sujian Li, Xiang Yue, Yifan Song","submitted_at":"2024-03-04T21:50:29Z","abstract_excerpt":"Large Language Models (LLMs) have become integral components in various autonomous agent systems. In this study, we present an exploration-based trajectory optimization approach, referred to as ETO. This learning method is designed to enhance the performance of open LLM agents. Contrary to previous studies that exclusively train on successful expert trajectories, our method allows agents to learn from their exploration failures. This leads to improved performance through an iterative optimization framework. During the exploration phase, the agent interacts with the environment while completing"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.02502","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.02502/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.02502","created_at":"2026-07-05T08:42:22.114272+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.02502v2","created_at":"2026-07-05T08:42:22.114272+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.02502","created_at":"2026-07-05T08:42:22.114272+00:00"},{"alias_kind":"pith_short_12","alias_value":"JDQUNRBS2JPH","created_at":"2026-07-05T08:42:22.114272+00:00"},{"alias_kind":"pith_short_16","alias_value":"JDQUNRBS2JPH7WLK","created_at":"2026-07-05T08:42:22.114272+00:00"},{"alias_kind":"pith_short_8","alias_value":"JDQUNRBS","created_at":"2026-07-05T08:42:22.114272+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22385","citing_title":"MetaPS: Adaptive Programmatic Strategy Selection for Market Agents","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21740","citing_title":"Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17628","citing_title":"OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation","ref_index":115,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10507","citing_title":"HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01581","citing_title":"Agent System Operations: Categorization, Challenges, and Future Directions","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24828","citing_title":"Test-Time Deep Thinking to Explore Implicit Rules","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27209","citing_title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28775","citing_title":"Learn from Weaknesses: Automated Domain Specialization for Small Computer-Use Agents","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12191","citing_title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","ref_index":285,"is_internal_anchor":false},{"citing_arxiv_id":"2506.23978","citing_title":"LLM Agents Are the Antidote to Walled Gardens","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2501.09686","citing_title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","ref_index":137,"is_internal_anchor":false},{"citing_arxiv_id":"2603.29908","citing_title":"C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10500","citing_title":"SkillEvolver: Skill Learning as a Meta-Skill","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08178","citing_title":"Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23194","citing_title":"From Coarse to Fine: Self-Adaptive Hierarchical Planning for LLM Agents","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08178","citing_title":"Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling","ref_index":4,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7","json":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7.json","graph_json":"https://pith.science/api/pith-number/JDQUNRBS2JPH7WLKZGPYRMFXD7/graph.json","events_json":"https://pith.science/api/pith-number/JDQUNRBS2JPH7WLKZGPYRMFXD7/events.json","paper":"https://pith.science/paper/JDQUNRBS"},"agent_actions":{"view_html":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7","download_json":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7.json","view_paper":"https://pith.science/paper/JDQUNRBS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.02502&json=true","fetch_graph":"https://pith.science/api/pith-number/JDQUNRBS2JPH7WLKZGPYRMFXD7/graph.json","fetch_events":"https://pith.science/api/pith-number/JDQUNRBS2JPH7WLKZGPYRMFXD7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7/action/storage_attestation","attest_author":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7/action/author_attestation","sign_citation":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7/action/citation_signature","submit_replication":"https://pith.science/pith/JDQUNRBS2JPH7WLKZGPYRMFXD7/action/replication_record"}},"created_at":"2026-07-05T08:42:22.114272+00:00","updated_at":"2026-07-05T08:42:22.114272+00:00"}