{"as_of":"2026-08-05T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47e9f2d9f4163f26990966b9ad8ff96115ea5c7893cc0391c156c90ac2508d5e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:45:49.665576Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16257/citation-record","integrity":"/paper/2607.16257/integrity","json":"/paper/2607.16257/citation-record.json","paper":"/paper/2607.16257"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-02T09:45:49.543804Z","title":"K., Xu, H., and Shen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.543804Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:20db00827887e6d5933a12a2c85c0ca4f5a9d1c642b156f3470a3f9b68a7e65a","observation_id":"f114d361-add9-4ea6-a055-b6a0b6bc87b7","resolution":{"observed_at":"2026-08-02T09:45:49.543804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02039","last_updated":"2026-06-08T03:25:04Z","snapshot_observed_at":"2026-08-03T07:51:57.376334Z","submitted_at":"2024-04-02T15:34:18Z","title":"A Survey on Large Language Model-Based Game Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02039","snapshot_observed_at":"2026-08-02T09:45:49.548413Z","title":"R., Ilhan, F., Tekin, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.548413Z"},"links":{"cited_paper":"/paper/2404.02039","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:16dc798dedc732614ab0fead282bc2fcd34710610ab769dd7a5301b17c51049b","observation_id":"d96548a6-2f08-45e0-a554-333d234194e3","resolution":{"observed_at":"2026-08-02T09:45:49.548413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T09:45:49.552902Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.552902Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:b4a33c06b1bd2665f854e349815523bfe7f11b356fce0ff08635ab9818fd3ae2","observation_id":"6a7d3ae8-eeaf-4855-958e-11c89f6d6b4b","resolution":{"observed_at":"2026-08-02T09:45:49.552902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-02T09:45:49.557487Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.557487Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:af6107d5b3d4681c0fe43ed213dfe1126fc014de117b6cbcb12c34805311622a","observation_id":"ba5d6b48-4691-4b86-99e8-66df3c35fabb","resolution":{"observed_at":"2026-08-02T09:45:49.557487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-02T09:45:49.562419Z","title":"S., and Zettlemoyer, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.562419Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:5da73cf40be0fdbab50808b6d32a8460f77d9ad1d8cec2bea052299de9636666","observation_id":"20f932c5-e23c-4d12-bf13-d43e33f49ba3","resolution":{"observed_at":"2026-08-02T09:45:49.562419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-02T09:45:49.571527Z","title":"Gui- r1: A generalist r1-style vision-language action model for gui agents.arXiv preprint arXiv:2504.10458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.571527Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:c9c5d3fc814cef1f6d8a92ea7a865889de8c51ff6188d25dbf37f02efe16ee82","observation_id":"9d567aa5-be18-4a84-afc7-17334a4ea033","resolution":{"observed_at":"2026-08-02T09:45:49.571527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11027","last_updated":"2026-05-25T11:34:07Z","snapshot_observed_at":"2026-07-06T21:41:14.693158Z","submitted_at":"2025-05-20T11:28:48Z","title":"From Reasoning to Code: GRPO Optimization for Underrepresented Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11027","snapshot_observed_at":"2026-08-02T09:45:49.579989Z","title":"From reasoning to code: Grpo opti- mization for underrepresented languages.arXiv preprint arXiv:2506.11027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.579989Z"},"links":{"cited_paper":"/paper/2506.11027","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:2f8030cf6828f64812ed2a80d6e0c2d5145b702160b32492a540b302bc3d9653","observation_id":"d8072b01-5ff9-4ae2-b0f2-9a7d00c28c66","resolution":{"observed_at":"2026-08-02T09:45:49.579989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.584554Z","title":"Adapt: As-needed decompo- sition and planning with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.584554Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:376bf224ff09f214c7e89a0b0573fe3f909a8e297961d00dc9c49cac8430f583","observation_id":"4055e064-4f29-42cc-b94e-449dfbbec35f","resolution":{"observed_at":"2026-08-02T09:45:49.584554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.588777Z","title":"A., and Lewis, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.588777Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:eae80938648bbaff46cdb2bf4dd501d7a693459e9c2e1ce80a026a10374b7201","observation_id":"dc122ef0-c6d1-4017-8f4d-9b4c54bf670f","resolution":{"observed_at":"2026-08-02T09:45:49.588777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T09:45:49.593092Z","title":"Schulman, J., Wolski, F., Dhariwal, P., Radford, A., and Klimov, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.593092Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:7545da1374b945c43f2452647bd2c94dae4d1d00be647936343982dfa52c3cf4","observation_id":"be1a788c-6562-43b2-89f4-218ee59d5c37","resolution":{"observed_at":"2026-08-02T09:45:49.593092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T09:45:49.597133Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.597133Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:40abbe59a89f466f9e282cf953053428051ec4ea51ee18ebb868ece54bd2d7bd","observation_id":"313da221-8f45-4d14-b924-9fa21835b6d6","resolution":{"observed_at":"2026-08-02T09:45:49.597133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-02T09:45:49.601208Z","title":"Zerosearch: In- centivize the search capability of llms without searching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.601208Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:240239646c50ff2e02ede4c1543036d8fb642ad0d70865ac67b47002459e5d26","observation_id":"cd6c5b9b-c9c2-421b-962b-f0f5f56503ae","resolution":{"observed_at":"2026-08-02T09:45:49.601208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.613518Z","title":"Simpletir: End-to-end reinforcement learning for multi-turn tool-integrated reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.613518Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:914b0d8853ed304f0603cd7dc0ad093f7788297190a1638a61a1b7ad796733b3","observation_id":"201aacc8-872c-42c7-9d8e-6006877df8f3","resolution":{"observed_at":"2026-08-02T09:45:49.613518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.617672Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.617672Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:340885887376b2c9809d3e4036c4bdf9f80d9dedda37b16f69abcd6585e343a1","observation_id":"30bd35b0-5d8f-47b4-820b-8998ed61cd80","resolution":{"observed_at":"2026-08-02T09:45:49.617672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T09:45:49.621635Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.621635Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:fca35b3bf929e1c2dd26d938ae59cc528d0d112519c9f817aea2b1fe312b356b","observation_id":"6477b146-22e0-4b29-84b7-91020de15fca","resolution":{"observed_at":"2026-08-02T09:45:49.621635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.625645Z","title":"and Zhang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.625645Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:455b38f7ac16b84638e3875614f6eeaf946f1093d7c5329e0b8022d1550d7754","observation_id":"c25d05f8-59e8-4e7c-8b30-ae901b57b9b2","resolution":{"observed_at":"2026-08-02T09:45:49.625645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.630037Z","title":"doi: 10.18653/v1/2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.630037Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:5d29b6a3df441d7c9c6eabc29d1d591a9341cbf730dc2b7aa43461b759ebcc97","observation_id":"09e75ab7-187a-4056-81d8-d5629d1447ac","resolution":{"observed_at":"2026-08-02T09:45:49.630037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.634091Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.634091Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:7628efa5a1def60aae580164ba9beb3a653da37f2aa5b7b5f2fb6761d9cf6813","observation_id":"8cc84f77-a5f7-4edb-8c98-553b685facf8","resolution":{"observed_at":"2026-08-02T09:45:49.634091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.642356Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.642356Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:c074cda954445e3ba5797d25602294f2ae603e44635e08ecfbc85021e7ecc4c7","observation_id":"db2481b3-ccec-44a0-a7b1-cc4bcf4cb9e0","resolution":{"observed_at":"2026-08-02T09:45:49.642356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.650631Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.650631Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:83c7d21740688ea3c7a07cfd35bfe4363eae2d11b467b8c46983e0a4be2f45ec","observation_id":"4b7ed04b-be6e-4d6f-92b4-9edf4f7450f4","resolution":{"observed_at":"2026-08-02T09:45:49.650631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.658063Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.658063Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:3822bd9474ab464327f69aa93580f334f830bcdee695f1c1d8e748d9ae4feb0c","observation_id":"f797b167-8465-40c4-b821-4973b3bccf4a","resolution":{"observed_at":"2026-08-02T09:45:49.658063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.661908Z","title":"Therefore, the answer is","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.661908Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:db67dbc2beda3f135e13870ff0d36db5e108a972437df71225d85423137c500f","observation_id":"eb2a3f79-5d92-49af-9a5a-f1e825255ae9","resolution":{"observed_at":"2026-08-02T09:45:49.661908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.665576Z","title":"Therefore, the answer is 1982.< /think> <answer>1982< /answer> (As = +0.377) User:Congratulations! You have answered the question correctly!!! 21","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.665576Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:3a0b27dc3c8bd532ab9a8cdce9fc0fa8682a0e1e78707b46c57a5eac5ad372b3","observation_id":"d67c3502-94fd-48e4-ac78-d705b89928e7","resolution":{"observed_at":"2026-08-02T09:45:49.665576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-02T09:45:49.605488Z","title":"N., Liu, L., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.605488Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:268234efff38b2dc6338e51bbc961c4b1687bda4a7b681b4d3263754f2e4b65a","observation_id":"b6a23d0b-ff2c-4156-9c67-44fa9a8e2822","resolution":{"observed_at":"2026-08-02T09:45:49.605488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00054","last_updated":"2023-12-19T20:14:51Z","snapshot_observed_at":"2026-07-06T15:21:23.714725Z","submitted_at":"2023-04-28T19:05:16Z","title":"LAVA: Data Valuation without Pre-Specified Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00054","snapshot_observed_at":"2026-08-02T09:45:49.567251Z","title":"A., Kang, F., Wang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.567251Z"},"links":{"cited_paper":"/paper/2305.00054","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:164bac95e54717906adb39417704384ac8d7b488b07325ec84f5b12bdf47f712","observation_id":"5ac0cc34-16d4-49af-b040-5518247ae594","resolution":{"observed_at":"2026-08-02T09:45:49.567251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T09:45:49.609534Z","title":"Agentgym- rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.609534Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:3a450ac93cb4467aab8d96f149739cc8160030c67c478915b6f12a0189bc298e","observation_id":"763e6f28-3062-4056-96fa-b9052d9b42fb","resolution":{"observed_at":"2026-08-02T09:45:49.609534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-02T09:45:49.575726Z","title":"When not to trust language models: Investi- gating effectiveness and limitations of parametric and non- parametric memories.arXiv preprint arXiv:2212.10511, 7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.575726Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:b0276150e4f5df81c6887ce9133e575673df8c3fa94f690c98be1ae68a14e595","observation_id":"cbbb27ec-3774-42fd-8c84-f3db1cfc6e06","resolution":{"observed_at":"2026-08-02T09:45:49.575726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T09:45:49.539339Z","title":"D., Sugawara, S., and Aizawa, A","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.539339Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:19eaeb6e53c57f03c14e3ae88807ac54c50a01e07dddc8cfb0d9e678bca56f94","observation_id":"a74b787b-e60c-4ba7-88e0-0eee59648c1b","resolution":{"observed_at":"2026-08-02T09:45:49.539339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-05T18:32:49.850038Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-02T09:45:49.534257Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.534257Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:fa360a01d5a2e4929127e4c0666fb20f3c6d6aef9a57a3f9c2a7d8709ac6c167","observation_id":"0812fa76-c88c-4290-9848-71d20c002f2b","resolution":{"observed_at":"2026-08-02T09:45:49.534257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.16257."}