{"as_of":"2026-08-12T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb38eac400c9e4f342014310f3e14db42c3af0e34ebaf7c82035d0e6b0d2f711","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:20:31.002411Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08255/citation-record","integrity":"/paper/2608.08255/integrity","json":"/paper/2608.08255/citation-record.json","paper":"/paper/2608.08255"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-11T20:02:47.955306Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-12T00:20:30.881986Z","title":"Test-time adaptation for llm agents via environment interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.881986Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:659de73bfb86e77f1b2564bd8e566f839d060d82d47d174a3ff3b30994ca82bc","observation_id":"d90394ae-8bf4-421a-81a6-97acf69a6280","resolution":{"observed_at":"2026-08-12T00:20:30.881986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-12T00:20:30.898822Z","title":"Lang Feng, Zhenghai Xue, Tingcong Liu, and Bo An","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.898822Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:dee8cbbb8d59ba28e94329aa4aafbcb6fb3419c71d39d8920b798908b2a877a4","observation_id":"5dc7db82-d1bf-4bd7-a164-b663e62831fd","resolution":{"observed_at":"2026-08-12T00:20:30.898822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-07-06T15:29:50.743434Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-08-12T00:20:30.903845Z","title":"Hiroki Furuta, Ofir Nachum, Kuang-Huei Lee, Yutaka Matsuo, Shixiang Shane Gu, and Izzed- din Gur","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.903845Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:065bd08915a666a70d55092782ba7fec6bdc1081377ced64d147d52f7a6b4ccb","observation_id":"fb549041-a873-461a-8fb4-e4a36e6be90a","resolution":{"observed_at":"2026-08-12T00:20:30.903845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.915025Z","title":"Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng, and Bo An","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.915025Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:2c2bd707ed9da340f3714b0abe322e48d616a6ddb1d0dafa837b0993d6f77804","observation_id":"5f552ab7-7564-4b60-9ea0-0f450dc67aa4","resolution":{"observed_at":"2026-08-12T00:20:30.915025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.16995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16995","snapshot_observed_at":"2026-08-12T00:20:31.411452Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"2b27bc3e-a652-42ec-8d33-96b556e54fb9","year":2026},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.920209Z"},"links":{"cited_paper":"/paper/2604.16995","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:db727d503f9e9ea52aaa5a93e632d5a8f75926e52c7cb6944c47dfb9cfc1ff0f","observation_id":"f1bdb373-645c-4c2d-b478-0a7e8fc05de0","resolution":{"observed_at":"2026-08-12T00:20:31.418525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04617","last_updated":"2025-07-18T17:06:00Z","snapshot_observed_at":"2026-07-06T19:11:49.583622Z","submitted_at":"2024-09-06T21:00:57Z","title":"Sparse Rewards Can Self-Train Dialogue Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04617","snapshot_observed_at":"2026-08-12T00:20:30.924964Z","title":"Barrett Martin Lattimer, Varun Gangal, Ryan Mcdonald, and Yi Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.924964Z"},"links":{"cited_paper":"/paper/2409.04617","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:4bfec6de36b816414dcedb845f909a431316d4bdfccaf47efc91b41a5c331509","observation_id":"20d99a4f-11f2-4944-b987-753ae45f1b6c","resolution":{"observed_at":"2026-08-12T00:20:30.924964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-12T00:20:30.935549Z","title":"Hunter Lightman, Vineet Kosaraju, Yura Burda, Harrison Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.935549Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:21adae63c44aaf4531d40fbda25bbfba0324131eb1049e275e2b1c2d251b68a0","observation_id":"951ad88b-d8f3-4151-8833-7524d42e3994","resolution":{"observed_at":"2026-08-12T00:20:30.935549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-06T05:10:41.210993Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-12T00:20:30.941220Z","title":"Eduardo Pignatelli, Johan Ferret, Matthieu Geist, Thomas Mesnard, Hado van Hasselt, and Laura Toni","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.941220Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:11a45c7967983686290005b7da2cc04b5e0dbefc673524fd5d957dacde35ffbf","observation_id":"0a1e9ed0-3451-4c16-857d-22bd399370dc","resolution":{"observed_at":"2026-08-12T00:20:30.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-12T00:20:30.951443Z","title":"11 Timo Schick, Jane Dwivedi-Yu, Roberto Dess `ı, Roberta Raileanu, Maria Lomeli, Luke Zettle- moyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.951443Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:4467e9ca4b2bf8ba648d383b07b0ecc877bd0a4e7ddb50c93a0eea7594e656d8","observation_id":"9385ed41-af56-4b1d-8836-f1b0e782bdd0","resolution":{"observed_at":"2026-08-12T00:20:30.951443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T00:20:30.956539Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.956539Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:7688d3c21c2d603c9b7276bed28415a07c613346b334db2e07b356febefe305e","observation_id":"ef0a00af-47bd-490e-adbb-aca16bc14dad","resolution":{"observed_at":"2026-08-12T00:20:30.956539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-12T00:20:30.966366Z","title":"Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Cˆot´e, Yonatan Bisk, Adam Trischler, and Matthew J","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.966366Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:5f86e8fa1e710544ae5f76dc089f98e37a3f35f2e0bc686114efc6b7d56df225","observation_id":"284107c9-dd1b-4155-b113-ab125fd0a0fc","resolution":{"observed_at":"2026-08-12T00:20:30.966366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.977076Z","title":"Chenglong Wang, Hang Zhou, Yimin Hu, Yi Huo, Bei Li, Tongran Liu, Tong Xiao, and Jingbo Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.977076Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:f3287ed708707bc0085933099102ff76775ab70c32077619222191fdbe9dd54f","observation_id":"15cddf84-14e0-4aa5-990a-35b31922c348","resolution":{"observed_at":"2026-08-12T00:20:30.977076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T00:20:30.982441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.982441Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:873a2a80ee68e344bf49169f60f308bf31827d99fe19fadfcbe914217a66b7a8","observation_id":"1e85fd38-0071-47a6-93d1-ab29797e7564","resolution":{"observed_at":"2026-08-12T00:20:30.982441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01206","last_updated":"2023-02-08T01:39:30Z","snapshot_observed_at":"2026-07-06T13:27:22.300465Z","submitted_at":"2022-07-04T05:30:22Z","title":"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01206","snapshot_observed_at":"2026-08-12T00:20:30.987486Z","title":"org/CorpusID:274859421","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.987486Z"},"links":{"cited_paper":"/paper/2207.01206","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:60d9c1ca116da5079894efc58471bbba4b0b7f475e901c94e522183ea1116bd8","observation_id":"ea9b2aac-c0ec-4774-ac53-d88079310eaf","resolution":{"observed_at":"2026-08-12T00:20:30.987486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T17:33:49.286933Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-12T00:20:30.992560Z","title":"Yufeng Yuan, Yu Yue, Ruofei Zhu, Tiantian Fan, and Lin Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.992560Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:fce0f1d5d01189654696376c9bcece4282d2a6cb0d3bd530fc4825118c2e5361","observation_id":"af1ee5bb-ac15-47a5-a867-87075d555589","resolution":{"observed_at":"2026-08-12T00:20:30.992560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-12T00:20:30.997565Z","title":"semanticscholar.org/CorpusID:276766648","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.997565Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:51cd10900625f1172e0d84bd24835dc615e77b6f2827f1678381ba6e4c079f7f","observation_id":"47e83f44-986d-4074-9e94-65de6da1013a","resolution":{"observed_at":"2026-08-12T00:20:30.997565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-01T04:15:49.179138Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-12T00:20:31.002411Z","title":"Xuhui Zhou, Hao Zhu, Leena Mathur, Ruohong Zhang, Haofei Yu, Zhengyang Qi, Louis philippe Morency, Yonatan Bisk, Daniel Fried, Graham Neubig, and Maarten Sap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:31.002411Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:386ee40f2529b73b5eafbcb502a4cc053c9b0a607f26d99345d1fccaef5f2f11","observation_id":"8165469f-0a38-4d57-b00c-5c60b6b73de1","resolution":{"observed_at":"2026-08-12T00:20:31.002411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.972193Z","title":"Hindsight credit assignment for long-horizon llm agents.ArXiv, abs/2603.08754,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.972193Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:7ae4b8ddc2712e65204c19f260042cebd8ec075b6642b7641211d94475685603","observation_id":"40ac6398-d796-43b4-a6a3-86c19e1940d7","resolution":{"observed_at":"2026-08-12T00:20:30.972193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T00:20:30.961438Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Jun-Mei Song, Mingchuan Zhang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.961438Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:d5da38ba7a2077c7a3129d82925deb78d4442c083e50fc38673579666c7fd187","observation_id":"d5caeca4-f423-4630-a461-424602baec20","resolution":{"observed_at":"2026-08-12T00:20:30.961438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-07-06T15:57:53.178833Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-12T00:20:30.909215Z","title":"Izzeddin Gur, Hiroki Furuta, Austin Huang, Mustafa Safdari, Yutaka Matsuo, Douglas Eck, and Aleksandra Faust","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.909215Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:3fe33c79afc3c2b08cb4889dfb2d093c25d828b07c4ae74bd10bbcec5ef9a9b3","observation_id":"db603c01-77a3-440a-b6ab-8265efc89ac8","resolution":{"observed_at":"2026-08-12T00:20:30.909215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07166","last_updated":"2025-01-19T19:29:50Z","snapshot_observed_at":"2026-08-10T21:32:29.516212Z","submitted_at":"2024-10-09T17:59:00Z","title":"Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07166","snapshot_observed_at":"2026-08-12T00:20:30.930351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.930351Z"},"links":{"cited_paper":"/paper/2410.07166","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:c6abf59c100a0351eeb38bff5e158b7a18e36b7482d074f7031380d54108d718","observation_id":"d6092662-97d3-483f-9352-65d6c435a8a9","resolution":{"observed_at":"2026-08-12T00:20:30.930351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-07T20:22:20.692339Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09572","snapshot_observed_at":"2026-08-12T00:20:30.893043Z","title":"Lutfi Eren Erdogan, Nicholas Lee, Sehoon Kim, Suhong Moon, Hiroki Furuta, Gopala Krishna Anumanchipalli, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.893043Z"},"links":{"cited_paper":"/paper/2503.09572","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:62d06221df4f2592b2422d84d28c3135bb04611841bf2394690279abda2b3d06","observation_id":"e5ec0b2d-640a-441c-8c8d-848892cd796c","resolution":{"observed_at":"2026-08-12T00:20:30.893043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T00:20:30.887706Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.887706Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:905515e2b67dcb2c9643fe948a81d707c43c7153fb740c93a410e4594a2981fc","observation_id":"bf9020c1-d71a-4fc9-9863-446c487e5f0a","resolution":{"observed_at":"2026-08-12T00:20:30.887706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T03:15:19.806711Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.08255."}