{"as_of":"2026-08-16T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34134ec42dabb4e12bc49f373e66a51a6a701475bdce68bf4a64dc48de1139ac","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T20:42:48.585661Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04242/citation-record","integrity":"/paper/2607.04242/integrity","json":"/paper/2607.04242/citation-record.json","paper":"/paper/2607.04242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:5809ef5d0881837a2cb0430fcc1a6153b5504ef35eab85b9935c60c7249b2328","observation_id":"178ee030-9241-4f65-80b5-5bf31c43f516","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:2de0b7eb1d02e096fcea3ab102031ae9524107fe5814565199f92fe118904619","observation_id":"93976136-347c-4e67-a07b-36fa8d26a94d","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:6de64c46d52f3bf0582acf4be5081f41184303720bc42f51bf2847bafe3f5818","observation_id":"0a866a45-338b-463d-8713-e5a0ec7c328e","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:cbb873f964b8715e15779fca5edb5bda9e513aa47afe65e470d849b2c019735d","observation_id":"dabedd51-f93d-4cff-9dcc-ab4ffe9f28ab","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Group-in-group policy optimization for llm agent training.arXiv preprint arXiv:2505.10978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:d6f7f1681ac8034ac563b1ba928f9d9296fc7e89e3c3ded15f461a4d59100230","observation_id":"edf4455c-ab29-4126-ad7f-f65d9057ac9b","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:2d3187db0019c4200ad161d27f1d5d46b660846af2b14a799d0455935191af0e","observation_id":"64e0cb62-eda7-4d44-9cf7-0e300816ebda","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Agentbench: Evaluating llms as agents.arXiv preprint arXiv:2308.03688,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:0536bb3a0acda8237754cf67481df3da05e0ad1f9878cc793b799ac1294d64f1","observation_id":"749e3263-caa9-4f95-ad41-54336055499e","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:3451f5ef75f73e13df0b7d61682be0c96545eab2144f5bc86ed60ca4ca882f8a","observation_id":"8e4a3955-d5ed-4530-8ff1-9ed8a0726123","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:1a96321032a6a147e30bca64e3371eec6784f898690c0746fa53169ebec9abc0","observation_id":"e87dcbcb-7037-4b0b-b2fb-8c8199957eee","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:f2d698549c17094e6496b0afa80d00985482e6f2b581ea52f0af37ca709d14bc","observation_id":"441ad118-9f5f-4ae6-a75d-57c47984b60c","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning.arXiv preprint arXiv:2504.20073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:16ef3db821153130cc0ab1b7584b9341f6cf2e2b853ce0b3e33dd57c136b9d3a","observation_id":"81905e31-a397-4083-8ada-1d9aa26f3c55","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:195b4b246d00b23e61676544c01521feff7bc5e8f98aaa43d1184f067f5ff21b","observation_id":"8a6fa4ea-990c-445c-9f08-767973d964ec","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T20:42:48.585661Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T20:42:48.585661Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.04242"},"observation_digest":"sha256:02e6b6e4aa27840a8cec238a217acf7dca237f476f401f907841a985348a99aa","observation_id":"9787f238-e3d7-4b05-8b14-a3bbd516f723","resolution":{"observed_at":"2026-07-11T20:42:48.585661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04242","last_updated":"2026-07-05T11:41:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T00:23:25.634746Z","submitted_at":"2026-07-05T11:41:46Z","title":"Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.04242."}