{"as_of":"2026-08-18T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ae380b4d711022d27f032e4da35695c83fa86a696ea22a9086db3286046fa6a","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:35:45.084011Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T22:51:52.859785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20061","snapshot_observed_at":"2026-07-31T22:51:52.859785Z","title":"arXiv preprint arXiv:2605.20061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27937","last_updated":"2026-07-30T09:47:58Z","snapshot_observed_at":"2026-08-13T13:07:27.719418Z","submitted_at":"2026-07-30T09:47:58Z","title":"From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T22:51:52.859785Z"},"links":{"cited_paper":"/paper/2605.20061","citing_paper":"/paper/2607.27937"},"observation_digest":"sha256:e3aaa534e608df1df03f0b1ea2aa143d770fce07d9c7921823ec00dd9d36bce6","observation_id":"be776092-685d-4b9a-8c28-90ea9b07680a","resolution":{"observed_at":"2026-07-31T22:51:52.859785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20061/citation-record","integrity":"/paper/2605.20061/integrity","json":"/paper/2605.20061/citation-record.json","paper":"/paper/2605.20061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.086056Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"f42c8e62-7c0d-4824-b1a2-906653781f5c","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:3a6a2508fbb2b5f17b95314f274fc4a7ad2364ca922b7bb900d4ee45a32f3846","observation_id":"012ea2ec-3a8e-4547-aaf9-aac28ec6acaf","resolution":{"observed_at":"2026-05-20T05:43:24.623982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":"335fdb09-5367-4de3-921c-613d567a0c53","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:1b74818420bee7372795f3197e403da3f939bdd30250499523de56b70deda72b","observation_id":"dd1f9a8d-ad26-4961-a91f-ad0d90bc6ffc","resolution":{"observed_at":"2026-05-20T05:43:24.595551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:46843b28be1fd7313e8d3d08be902f6c4b51aad0d966a05cfe0cb7f6b4f7b91b","observation_id":"8312bc98-f50d-4c52-9068-4cd3ade9f260","resolution":{"observed_at":"2026-05-20T05:38:05.576948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.506549Z","title":"arXiv preprint arXiv:2511.16108(2025)","venue":null,"work_id":"cd691b36-09ff-4fda-9a35-a206d861e133","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:f332e278782d24fa4c9c5e8e9f245a8f996f6570f35cef1a2cd18805fd1b3592","observation_id":"96854874-9cc5-4dd8-8337-aaa084eb7e79","resolution":{"observed_at":"2026-05-20T05:38:05.629513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse2dense: A keypoint-driven generative framework for human video compression and vertex prediction","venue":null,"work_id":"5de6d8bc-43c5-47d4-88d9-7f5a399b40d1","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:d63b2c3c49e03c0115b639f23e2aba510ced943ae6d05e3435d5fa49505bbe0e","observation_id":"7f9a707d-2739-4f66-a25d-cfedcc0afaa5","resolution":{"observed_at":"2026-05-20T05:38:05.637540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-18T03:07:34.996948Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":"2502.01600","doi":"10.48550/arxiv.2502.01600","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning for long-horizon interactive llm agents","venue":"ArXiv.org","work_id":"7e929792-6a2a-42ff-a1db-763f890d8b4e","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:723d34d631bc53746107394f7913494a15bd2982903d9ab511fc770c8f403d58","observation_id":"fe5798ea-0ed8-40ee-bd67-1950eebb2d83","resolution":{"observed_at":"2026-05-20T05:38:05.569721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00777","last_updated":"2026-05-28T05:41:01Z","snapshot_observed_at":"2026-08-07T02:24:57.284896Z","submitted_at":"2025-10-01T11:16:04Z","title":"In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration","version":2},"cited_work":{"arxiv_id":"2510.00777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00777","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chung, Moon Jeong Park, and Dongwoo Kim","venue":null,"work_id":"49e1bced-c1e8-431d-9935-4e6b994c6682","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2510.00777","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:3205da5e54944b458a60f9bf3c8de4e20638042c6b194eab1d027e8acce98a30","observation_id":"fea07252-93ec-4980-b5e9-f72545c22899","resolution":{"observed_at":"2026-05-29T02:04:56.900644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-17T04:59:59.434643Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:f016708960d638ba43734c0c592199c7699dc63c13b75a1809e4a6677b2fb036","observation_id":"3c5d387c-8159-4439-8748-2ae3e97f5b7b","resolution":{"observed_at":"2026-05-20T05:38:05.597087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12942","last_updated":"2024-08-30T07:30:13Z","snapshot_observed_at":"2026-08-16T13:24:23.340579Z","submitted_at":"2024-08-23T09:46:15Z","title":"Causal-Guided Active Learning for Debiasing Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.12942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal-guided active learning for debiasing large language models.ArXiv, abs/2408.12942","venue":null,"work_id":"a0e757d5-20f8-44a2-9db8-e164ee305691","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2408.12942","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:4f6e53a85f39a5833ab14c4093866f38e375788a77963001cb6eafaa0eaf2e7e","observation_id":"31fa0f1d-f338-4d9d-99d8-9a2c52ff711a","resolution":{"observed_at":"2026-05-20T05:38:05.609691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17419","last_updated":"2025-06-20T18:34:04Z","snapshot_observed_at":"2026-08-16T12:09:37.722225Z","submitted_at":"2025-06-20T18:34:04Z","title":"UProp: Investigating the Uncertainty Propagation of LLMs in Multi-Step Agentic Decision-Making","version":1},"cited_work":{"arxiv_id":"2506.17419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17419","snapshot_observed_at":"2026-07-04T03:39:30.656744Z","title":"Uprop: Investigating the uncertainty propagation of llms in multi-step agentic decision-making","venue":null,"work_id":"b02b9ae5-d968-46e6-a171-5f47c6f0fd70","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2506.17419","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:36b3595b5c2d649850b8e9749cf47fba3eb496c2bde93dc56059a3846977cd65","observation_id":"d6ee478c-0d33-46d2-b74f-66c82d0dfd3a","resolution":{"observed_at":"2026-05-20T05:38:05.556220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:bb295d1765d0ea60f9a6300fd49dc22c028a3ed950cdb58c5d77ee0eb37dfded","observation_id":"37cda70b-f966-4fed-82e0-ff2e5503d418","resolution":{"observed_at":"2026-05-20T05:38:05.561954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":null,"work_id":"1d6301bc-63b4-40c8-9b3a-2b5b990a29ee","year":2026},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:6ea322729e8cfbe66828232265ba21b07358e04a379f9be6b799fd752e129ef4","observation_id":"9b88eeb2-e5d9-444f-82b7-04f9cc4a0ca4","resolution":{"observed_at":"2026-05-20T05:43:24.615287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on llm-as-a-judge.The Innovation","venue":null,"work_id":"0d371590-0457-47ad-8f65-15c0e366e326","year":2026},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:ccf9d711f31b1f931bf239a3412166cd8906f03705a02bd0c7de2becde907cc0","observation_id":"eb0fd076-7e1f-4a4f-b105-2640a98e096c","resolution":{"observed_at":"2026-05-20T05:43:24.592049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.512699Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638","venue":null,"work_id":"f01253de-58e9-4b0f-a91e-4ef797517a24","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:68dc99fb6cbee2a2fa5ae32d46f16cc62c4f98ad154533ecdd20941689a596e6","observation_id":"ccad7092-8913-47ea-95d8-154beb4e1c4b","resolution":{"observed_at":"2026-05-20T05:43:24.580201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":"d216b31a-1fbe-4e1c-9b25-9bdf66209b4b","year":2020},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:4a02266ed31d411b2f40fd5de4f2d2650acc7db14af0f327520889b61876359d","observation_id":"536ea10e-a0fe-474f-afa9-d6eb8a971c87","resolution":{"observed_at":"2026-05-20T05:43:24.588522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reason- ing with language model is planning with world model","venue":null,"work_id":"6ab408b0-2b5e-41d8-8dc4-48a9d90b59c6","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:1da7f5b2acb6be96eb1549160a14608658f7b72f1d913c232b20efc8764c8b6a","observation_id":"2eef5082-7dca-4653-9404-39ef37fe7458","resolution":{"observed_at":"2026-05-20T05:43:24.556080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample-Efficient Multi-Round Generative Data Augmentation for Long-Tail Instance Segmentation","venue":null,"work_id":"9ac7fa5a-7709-4c2c-a678-593ca35829cf","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:a3fa154e476075a3178f896a493b6a53ffa8c09c706c6b3c101036a8229b3c28","observation_id":"c5a900b7-0a5f-4dde-b407-57e7a7d7707e","resolution":{"observed_at":"2026-05-20T05:43:24.574964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:8112fdecc4cf29a3d1ae0f233c2bc27eebe72f00e59772477b52d470c938b26e","observation_id":"5dc5fd74-4f94-469e-99f6-62e8a1d63375","resolution":{"observed_at":"2026-05-20T05:38:05.656716Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20111","last_updated":"2026-06-04T03:41:38Z","snapshot_observed_at":"2026-08-03T14:34:47.811827Z","submitted_at":"2025-12-23T07:11:26Z","title":"ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction","version":2},"cited_work":{"arxiv_id":"2512.20111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.20111","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abbel: Llm agents acting through belief bottlenecks expressed in language.ArXiv, abs/2512.20111","venue":null,"work_id":"0746e31d-9b69-4ed4-afb7-b8c39705ec60","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2512.20111","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:bff5f6f747ce716cadb99b61528dd2a9e982aaed0595d2a063f0359309270c58","observation_id":"72c95792-12f3-42aa-ac25-33d7645719b5","resolution":{"observed_at":"2026-06-05T02:15:32.426400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.560761Z","title":"Let’s verify step by step","venue":null,"work_id":"1e1d0751-e17d-4e3e-aa61-95245c4f49c8","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:a66a698ba8f4355a8b624d57e03b2610a9cb480f740a9b754d57ff5469d1f3f9","observation_id":"c57c37ad-9882-4127-b0e7-4c4e70b8d627","resolution":{"observed_at":"2026-05-20T05:43:24.559369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-08-12T16:45:40.094278Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"cited_work":{"arxiv_id":"2504.01990","doi":"10.48550/arxiv.2504.01990","metadata_source":"pith","pith_arxiv_id":"2504.01990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","venue":"cs.AI","work_id":"984dfe5e-1c5c-4b65-920e-15121a85ee7e","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2504.01990","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:ef49acb4888eb2dcc18858b852064a0eab47ddc5a0744317de70b6ead09e31db","observation_id":"dbdc0305-8223-4178-8ff1-cade817a5fc2","resolution":{"observed_at":"2026-05-20T05:38:05.476364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19199","doi":"10.48550/arxiv.2509.19199","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic reinforcement learning with implicit step rewards","venue":"ArXiv.org","work_id":"6eb5e259-3013-4695-8aa8-ec5df9a9d481","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:d19527f381ad69adffe13ea3f00165973c5ab9482c6a2d71c35743a633b1b8e2","observation_id":"1d16f286-4699-4d31-9965-58a52a70115c","resolution":{"observed_at":"2026-05-20T05:38:05.616554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbolic and subsymbolic geoai: Geospatial knowledge graphs and spatially explicit machine learning.Trans","venue":null,"work_id":"b0d7dcd2-ea68-4aa5-ad14-2c3bb913a2f3","year":2022},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:2907da005553b51fb031d27c28d12db808a2d1471666602dca97d3922cfaec15","observation_id":"dde12716-7245-4f66-8666-2fff40799569","resolution":{"observed_at":"2026-05-20T05:43:24.584526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07842","last_updated":"2023-02-15T18:25:52Z","snapshot_observed_at":"2026-08-15T09:25:47.428131Z","submitted_at":"2023-02-15T18:25:52Z","title":"Augmented Language Models: a Survey","version":1},"cited_work":{"arxiv_id":"2302.07842","doi":"10.48550/arxiv.2302.07842","metadata_source":"pith","pith_arxiv_id":"2302.07842","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Augmented Language Models: a Survey","venue":"cs.CL","work_id":"6426706e-f14a-4e4b-ade6-8414697a11d2","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2302.07842","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:8756af7afc406df756195eedfe36d3af37bc90506966a510abce2cbe828bae31","observation_id":"66ff8920-b637-422e-9234-891c994c2a83","resolution":{"observed_at":"2026-05-20T05:38:05.663138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty quantification in llm agents: Foundations, emerging challenges, and opportunities","venue":null,"work_id":"294bdd4d-0d71-46f5-9b2f-838a0e33efa3","year":2026},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:7360de11be0ee98ed45f85a262235307deb5b8a858a8ff3b7e5775682cfe89ab","observation_id":"607163d8-842d-4eca-8978-8dd92539bc64","resolution":{"observed_at":"2026-05-20T05:43:24.619793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:f1e7943e224e04fa83e82a76e05c6ae5f84e3847ee68ef489f27c0c3769af3c7","observation_id":"dead8b95-81ca-4233-9490-4607066f35e9","resolution":{"observed_at":"2026-05-20T05:43:24.628346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-14T15:46:52.927758Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":"2408.07199","doi":"10.48550/arxiv.2408.07199","metadata_source":"pith","pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","venue":"cs.AI","work_id":"af60de99-112e-4dda-bc6b-5ec7381cfaad","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:1eec753819a37773759d08e86092fc9117b25dce16e69c1d6896808832e49cfc","observation_id":"0f1eefb2-5760-4d62-8312-4efae2694fa6","resolution":{"observed_at":"2026-05-20T09:42:06.579174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-16T13:03:04.610722Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:b2969b4a88366ecf278cba966046369f345bb904d97188175aedffcba53ccfd8","observation_id":"b069b3c8-cb86-418f-94b9-e3117a4981e0","resolution":{"observed_at":"2026-05-20T05:38:05.549697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:ed153dff9326544d4e66339271d826a1611ca932f64d6b9a3cea8483094d91c9","observation_id":"74f3a646-af73-4093-9624-7a67d59c5b8a","resolution":{"observed_at":"2026-05-20T05:38:05.643313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:00:59.352854Z","title":"A possibility for implementing curiosity and boredom in model-building neural controllers","venue":null,"work_id":"a64a94a6-66e2-4bac-ab66-1a8dfe027a16","year":1991},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:418a5896e18d25745f50118d4d206110b53d06456894271f8ac32f127b837b87","observation_id":"cad7fdda-c1b9-451c-b078-33c44222fcaf","resolution":{"observed_at":"2026-05-20T05:43:24.611174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:4bbd174a6941c47797fb018059c0b808e215e8931ce48b56b5e556acf4ce8abe","observation_id":"30ef472a-92d5-4cc3-97a4-902a8226c098","resolution":{"observed_at":"2026-05-20T05:38:05.589891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:fa4b117abb736f54635150ebb5904277bb3036e4bbdfd7acf7df814b0a6b473b","observation_id":"7a71902c-632d-4363-9a7e-e9bd2d163928","resolution":{"observed_at":"2026-05-20T05:38:05.543201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:992753eaa69f76b6c497e0b23aee2a33f318d346e93385a778234a823d06fc77","observation_id":"c2ca204c-6241-40e0-afc0-1f11f80191cb","resolution":{"observed_at":"2026-05-20T05:38:05.525894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monte carlo tree search: A review of recent modifications and applications.Artificial Intelligence Review, 56(3):2497–2562","venue":null,"work_id":"b449c28c-44c9-4372-82f3-8290ef6ead58","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:b866e0b6da84169fcfe8a9955517563685e2d5a26e0e5f35a94d4462096e065c","observation_id":"d180fe40-4558-4732-a493-9eefd30a594c","resolution":{"observed_at":"2026-05-20T05:43:24.607710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:bd07869240a069e0ce5c63364580104aad0c24080be63a25660adf007344d9a2","observation_id":"e890ac0e-3c93-4f75-a7f8-2a656467d5f8","resolution":{"observed_at":"2026-05-20T05:38:05.649948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":"2312.08935","doi":"10.48550/arxiv.2312.08935","metadata_source":"pith","pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"cs.AI","work_id":"fb547990-d48e-4ba3-a047-af1e506e8290","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:1d9e7a175da95ed2a0b9030de1204a3b2530507abda6224d6a4be26a7be8423a","observation_id":"71b714c2-ce8d-4902-b461-f6355dafef08","resolution":{"observed_at":"2026-05-20T05:38:05.583384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:799e21a48da81aa2228e3eb5117416bf032f8720fc25b6ed057be7794c7917af","observation_id":"8f6170ba-ec94-4679-9880-94e7e6a78c23","resolution":{"observed_at":"2026-05-20T05:38:05.463079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:d21c14e62f37b25dd6b0fce7c42e410bf103c8c9a05d29c20b5ba259267613b3","observation_id":"b59c1e80-b311-4087-a119-9dbbe090a57a","resolution":{"observed_at":"2026-05-20T05:38:05.470067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-16T13:42:26.491534Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":"2406.11176","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-07-04T13:59:51.871553Z","title":"Watch every step! llm agent learning via iterative step-level process refinement","venue":null,"work_id":"a4789c21-1d58-4330-961c-e34441f18132","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:aab1f152c983340408126b3cc9895b35dd3aa31c7a934310d181b53edc6d7907","observation_id":"17c7d3ff-d50a-45d5-868b-bfe81a49f6fa","resolution":{"observed_at":"2026-05-20T05:38:05.519281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:71a7d12363835a53ed1493c1d0558fa719b957cfad0c3345b5e135f76178159a","observation_id":"62165ce6-d375-4406-99a3-6bcd1478482b","resolution":{"observed_at":"2026-05-20T05:38:05.603208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.367173Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents.Advances in Neural Information Processing Systems, 35:20744–20757","venue":null,"work_id":"084dea0a-7e9a-4848-922f-a5d43deed0a9","year":2022},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:764647aa2b164dc5fe520663bc890b137fa66c059462b30807ef2ad82047d5fd","observation_id":"fc52fa50-7a6d-4d03-9159-74fa85313a7b","resolution":{"observed_at":"2026-05-20T05:43:24.603719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems, 36:46595–46623","venue":null,"work_id":"94899971-6e69-40af-9ac9-b52beb6039e7","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:c60d65951c1f8bc65dac11aeb807ab671c44daf091bd60c98660d52a9d9e27a5","observation_id":"87b15eba-f30b-4a0f-aa93-ef773b398c8e","resolution":{"observed_at":"2026-05-20T05:43:24.599605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:35a857145485529a0d8fffefbc46b2853410035b792544cd42d5a84b23082176","observation_id":"d1c10b34-de1c-4fc3-874a-c8745195a556","resolution":{"observed_at":"2026-05-20T05:38:05.537641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T07:08:14.424698+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T07:08:14.424698+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-16T14:14:00.679899Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:6df3a2af156ff3fef340756ba89f29d69c73505971066978c223f4c4e94a4fb6","observation_id":"4ac2a3c3-7399-4a83-aacd-b7eedd783c24","resolution":{"observed_at":"2026-05-20T05:38:05.483436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:09:40.689499Z","title":"Enhancing agentic rl with progressive reward shaping and value-based sampling policy optimization","venue":null,"work_id":"0889d9fc-65f0-4e95-a80d-900dfcaf72fd","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:0eefb751f16d5251320356cef5409340ab4400ef7892b50ad4ce99c14c7ca669","observation_id":"efe056c7-d2ce-416f-b3d3-3d9bc68915a3","resolution":{"observed_at":"2026-05-20T05:38:05.496454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":27,"verified_fuzzy":16},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2605.20061."}