{"as_of":"2026-08-07T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09be76138d2453c500d3a2e29e2dee87fc1f9bec4703a53494b3c4a320b969a0","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:33:06.488657Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03702/citation-record","integrity":"/paper/2607.03702/integrity","json":"/paper/2607.03702/citation-record.json","paper":"/paper/2607.03702"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Reflect, retry, reward: Self-improving LLMs via reinforcement learning.arXiv preprint arXiv:2505.24726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:53a0988c5c33796d190abf54aada12e1d0d8a5a40c868e493ec39f2f83202299","observation_id":"959d28d3-e55a-4719-a13c-ac9a3d57164b","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-05T19:35:12.428969Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Soft adaptive policy optimization.arXiv preprint arXiv:2511.20347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:12e32bb421a026823e91015e6e85db3951706b566642344c21d5ffb1730c8268","observation_id":"3262efab-1047-4a2e-b3bc-7cf45fe30e57","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:a3151205b16a6deb7adb08c57eaf368ac183f8e5e37809d615d7f23fc8256a6b","observation_id":"70a98fff-27e1-4117-97ec-a411d8f9b5ec","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:2ae6f70560935c9b7b225cbeff2c183ad6150a1e3d5c998062a290cc6c3ec186","observation_id":"7cda9da9-3e62-49fd-baa4-61f36708cd5b","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Yinghao Li, Haorui Wang, and Chao Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:1295c716c27fe32f9dc71cda7a87f99d14732100eb05ac3d6807393f4eb0754b","observation_id":"f566925c-a7b8-44e2-b50f-3deb4b74c3eb","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02553","last_updated":"2026-01-29T15:45:24Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-05T21:02:49Z","title":"SimpleMem: Efficient Lifelong Memory for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02553","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Simplemem: Efficient lifelong memory for LLM agents.arXiv preprint arXiv:2601.02553,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2601.02553","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:1eb502400bdf56e527c3cf65a71a3899282279469eebc1bbb39658ed03890bf8","observation_id":"ac97ecc7-39de-4fcb-8b8f-afd960b0042f","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-06T01:14:44.790846Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Self-distilled agentic reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:0d1773fe36181b4c91a1fd303e2bb0ec0cb29b80529f40b340aa1f542dccbdb3","observation_id":"eceb5f1b-bf95-4805-91b6-f7f185cea1a5","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:8bacc8188feb6784ecd9f3932a23c1bdad6079835b351c22fe66a18d09ca0022","observation_id":"dd46e826-4f93-4f9f-b525-5d9c1352e1b4","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:75cbb3330834670daad042d4ac814c2e81f84d4a0743334f8ded8b7666312d5d","observation_id":"9bc99ff2-bf4f-4d2b-aa4e-5bfd34644a46","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Experiential reinforcement learning.arXiv preprint arXiv:2602.13949, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:9cc4267785b23994e01c6dfe9741755e0553929f4728929c329cd13e56e409f7","observation_id":"990de9bf-fb05-4282-a4ac-c72396371ae6","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Andrew Bagnell, Aarti Singh, and Andrea Zanette","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:c7fa553cc3edd40de7b2cef044d9e1cb74f03240c97cc2efee0489aa03a03126","observation_id":"ab6ddb41-db83-439c-9ce9-d545c92e1ad1","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Zerosearch: Incentivize the search capability of llms without searching.arXiv preprint arXiv:2505.04588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:a976a97a8a905a8027dcc037bd8aed1bddceed177e0e752324a9d793c5d50345","observation_id":"5c063ef8-7448-4456-9872-05c7a28ec0d3","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Information gain-based policy opti- mization: A simple and effective approach for multi-turn search agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:7d6caa1c5e5cbe831c0d1aae17593d0cc51bbc7c49456b8fd02f4333f4ad0b57","observation_id":"42fbcc21-3a76-4e7c-9dc0-234b73e2a021","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Ragen-2: Reasoning collapse in agentic rl.arXiv preprint arXiv:2604.06268, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:25076e78efc0b6e95568ed5adac15f65e2a239ccf2cb298ee20061706e4e294c","observation_id":"e2305126-e912-4ecb-8e5c-b2975f885fa4","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Meta-reinforcement learning with self-reflection for agentic search.arXiv preprint arXiv:2603.11327,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:b807052e17e4909172a3a002fc951dd7130d729d4d6598799b30f6bbfc055870","observation_id":"f1cde520-3c61-4568-80ea-b2f3ad259532","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"MAGE: Meta-reinforcement learning for language agents toward strategic exploration and exploitation.arXiv preprint arXiv:2603.03680,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:2fe216ae6addb0a79a45bed63ca332193ba259c49fedd9e6ef6043468d0f0395","observation_id":"ca7fe6f0-bbc7-4df2-8c8b-0f2721de1539","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"The landscape of agentic reinforcement learning for llms: A survey.Trans","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:9502e17a4e345695be4717447bc546bf19aef1463ddcc5b92179946ade54798c","observation_id":"53c62c7a-e8fd-4950-84fb-20e44709a45f","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, and Helen Meng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:09a2dbad27e8b0bbafc1acff7f3e4791d9707299aff534a991aa75cdf3eacd11","observation_id":"c34e7e5f-a8a7-40f4-b444-3fab060e95ae","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:d9d379a3a1a7a88bac649eb9aacfb3076c1b6b5628fe9c2aae6e90579612bf15","observation_id":"76a272b9-981f-4a40-bc55-c531dd7208f9","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2607.03702."}