{"as_of":"2026-08-05T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a9f6acb1e03954602240cec73516d528f75e95313edb6402368fade75e6c24d","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T18:54:12.287974Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:45:20.213019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26958","snapshot_observed_at":"2026-08-01T03:45:20.213019Z","title":"T ournament-grpo: Group-wise tournament rewards for reinforcement learning in open-ended long-form generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24850","last_updated":"2026-07-25T06:47:46Z","snapshot_observed_at":"2026-08-03T12:18:41.225352Z","submitted_at":"2026-07-25T06:47:46Z","title":"SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T03:45:20.213019Z"},"links":{"cited_paper":"/paper/2605.26958","citing_paper":"/paper/2607.24850"},"observation_digest":"sha256:09c9c5a01a70e88b371ede9e824e6aee0bcff47d52330d18e7fb006f1a45f85f","observation_id":"29e80624-d368-4dce-b65b-1becc619e022","resolution":{"observed_at":"2026-08-01T03:45:20.213019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.26958/citation-record","integrity":"/paper/2605.26958/integrity","json":"/paper/2605.26958/citation-record.json","paper":"/paper/2605.26958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":"2506.11763","doi":"10.48550/arxiv.2506.11763","metadata_source":"pith","pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","venue":"cs.CL","work_id":"449edaa7-8f9d-4170-952d-4ab0d740572c","year":2025},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:5c955c4dd8b860c64057cb2df32d74b0bd6ed299632f9b99808771397c7bd3ab","observation_id":"ea3269b1-723f-4083-9629-43f89a2235b6","resolution":{"observed_at":"2026-06-29T19:03:51.676587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:a2fccbd95acd0db2d323b5e9e6f3c246f434230e07b57fdffc30bcdf3556c9f3","observation_id":"b42d9c75-6cb1-46af-a9df-d7ae210f34f9","resolution":{"observed_at":"2026-06-29T19:03:51.679831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:7a7ed5e4fd299fda2e55a35ef886e6650deb07ae811b38a4840b531027140b2a","observation_id":"5ad1ebb8-5f75-45c0-a3ce-b4aaa5d68dd8","resolution":{"observed_at":"2026-06-29T19:03:51.672444Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:1f97641bd82884326afe3629deb56cf72161364a14050cf104d0f7f0613f24d8","observation_id":"678d383f-070b-4a2a-9e8c-e8fcfcd89991","resolution":{"observed_at":"2026-06-29T19:03:51.676298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:54:12.287974Z","title":"query\":","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:66c796a622f33fdbf3c196f70b2a06e2bd4822c1294f379ccf6d231f0b2adf4a","observation_id":"17665943-1fa0-4311-a2bb-a08751e4ff4c","resolution":{"observed_at":"2026-06-29T18:54:12.287974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:54:12.287974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:051b3687715acaaba2061d41d3d131ac89bbc43fa41b68fcd17e50b1abcf7e8d","observation_id":"9b5ebe72-64ad-49f6-9bd7-a05aeb16b743","resolution":{"observed_at":"2026-06-29T18:54:12.287974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:54:12.287974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:705b53877d8278030e65d9c4f875d9cae69c67139c39d866df3e163c500df929","observation_id":"4de462b2-b73d-4c42-9feb-49b5030b0633","resolution":{"observed_at":"2026-06-29T18:54:12.287974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:54:12.287974Z","title":"Each tool cycle must follow: <call_tool name=\"...\">...</call_tool> <tool_output>...</tool_output> <think>...</think>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:1b165bb86c94f803301ef574c059e3d639f7a24d6e5c585c6933eab3cbc9749e","observation_id":"f8caf034-7943-4c82-afe0-0a5e22074f2d","resolution":{"observed_at":"2026-06-29T18:54:12.287974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:54:12.287974Z","title":"google_search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:54:12.287974Z"},"links":{"citing_paper":"/paper/2605.26958"},"observation_digest":"sha256:44dac8f9bd99aa14bcd5547c0f587ff7c390f1fe9ab21ffa63c4c64f58500c72","observation_id":"758c813c-19dc-48a8-92ef-cbc25efd514d","resolution":{"observed_at":"2026-06-29T18:54:12.287974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26958","last_updated":"2026-05-26T12:49:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T09:26:59.584268Z","submitted_at":"2026-05-26T12:49:19Z","title":"Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 1 inbound Pith citation observation for arXiv:2605.26958."}