{"as_of":"2026-08-22T06:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37218e169adc86879317b9f1e5b804c64ebc107ce2c8d01349b19dd0e5090b47","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:55.897193Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:07.612952Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.713683Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-08-15T15:49:07.612952Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-21T08:21:29.485873Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.612952Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:ed0a61a32be7af2c0c49ead769e4166be2f79a689eca9d2d7b07903a4704625a","observation_id":"be2d50b4-5f92-4b7b-9444-e13a3ae5bbe5","resolution":{"observed_at":"2026-08-15T15:49:07.612952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2605.08873","last_updated":"2026-05-09T10:51:58Z","snapshot_observed_at":"2026-08-12T23:04:59.858122Z","submitted_at":"2026-05-09T10:51:58Z","title":"CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T00:59:44.364491Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2605.08873"},"observation_digest":"sha256:ab3b94bb3b8ae5a4d810e9b1fbcd3ccb5027d115c6ca71717bb2ac88af932583","observation_id":"340567cb-e213-49c1-938d-5e13ac4c09de","resolution":{"observed_at":"2026-05-12T08:31:26.497930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:e0af9c86febcc8d9e63732a0698700eaffb09ef39b914cf998f86c69dfb8111d","observation_id":"1e2cb5c6-f008-41d8-9cdf-d57deb0f46ce","resolution":{"observed_at":"2026-05-13T06:12:22.759733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:96332a498400db353c19c8d9ba916badab2cb26077a6280b845d4bc79968bb42","observation_id":"b9e69fa3-e40f-4cfb-8334-32dbe2cca0f6","resolution":{"observed_at":"2026-05-22T10:01:23.160661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-15T03:12:11.596791Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T11:51:01.769882Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:20ddf7894bfe08dce35de267192bd1c8d9521000ac1a3598458edfad0aa25508","observation_id":"64639df8-7838-4fb5-8962-e9ea3bb461ae","resolution":{"observed_at":"2026-06-29T11:53:23.678846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-08-02T12:58:10.962452Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-15T03:12:11.596791Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:58:10.962452Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:b0ea23a472ec70d95ff46428b63d77d0c1ef60f0c2b7d9255872118425f8369f","observation_id":"7fc63523-d7e1-434f-b8d7-ad74c1ad31a5","resolution":{"observed_at":"2026-08-02T12:58:10.962452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2606.04889","last_updated":"2026-06-03T13:51:27Z","snapshot_observed_at":"2026-08-17T17:14:59.103519Z","submitted_at":"2026-06-03T13:51:27Z","title":"GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T05:59:00.005336Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2606.04889"},"observation_digest":"sha256:97ac9b7c3f5c23ceb4b70e854facb937b46068f19131caa4e81e5bb79ee91071","observation_id":"1ba334c9-db92-4101-be60-18993d05933c","resolution":{"observed_at":"2026-07-02T08:36:47.644321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:9b2fe4f6af7d74ed1621ac28b2758af5d67d07a7daff42488ff9856b8f12e4e2","observation_id":"66ffc8c9-8175-4f9d-a9e2-a24b01b993b5","resolution":{"observed_at":"2026-07-04T08:09:40.715150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.02864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-04T08:09:40.713683Z","title":"arXiv preprint arXiv:2506.02864 , year=","venue":null,"work_id":"14ce32a8-5db9-49f8-b890-9695ba59f1ee","year":2025},"citing_paper":{"arxiv_id":"2606.29758","last_updated":"2026-07-27T10:44:50Z","snapshot_observed_at":"2026-08-15T11:21:14.929046Z","submitted_at":"2026-06-29T04:04:32Z","title":"PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T07:36:39.835616Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2606.29758"},"observation_digest":"sha256:ecd6fdc338f2cdeb1b89eeab1d6cc920bc2288ac14377836050fbd1960fdc043","observation_id":"f0105c2f-0ea7-4100-808a-26d1de6910b5","resolution":{"observed_at":"2026-06-30T08:04:29.019093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-07-12T01:51:25.883463Z","title":"Bnpo: Beta normalization policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03528","last_updated":"2026-07-03T17:59:02Z","snapshot_observed_at":"2026-08-02T12:10:15.366904Z","submitted_at":"2026-07-03T17:59:02Z","title":"Aligning Language Models with Selective Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T01:51:25.883463Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2607.03528"},"observation_digest":"sha256:0a4e64e264244925e04c5985618b2e518029a38cfc4b0e1c4c4832c6676780a3","observation_id":"93c0b0fa-9621-45d6-8aef-b56b0f3682c0","resolution":{"observed_at":"2026-07-12T01:51:25.883463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-08-01T08:01:23.300594Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21273","last_updated":"2026-08-04T10:37:25Z","snapshot_observed_at":"2026-08-07T23:11:42.684740Z","submitted_at":"2026-07-23T12:50:18Z","title":"The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:01:23.300594Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2607.21273"},"observation_digest":"sha256:4859a379d03481d85d7a9e808ce4a149b6c0ce429d22ee2641b8ade77be96c24","observation_id":"5d5f2df7-0534-44ca-88d3-6e66d96480bd","resolution":{"observed_at":"2026-08-01T08:01:23.300594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02864/citation-record","integrity":"/paper/2506.02864/integrity","json":"/paper/2506.02864/citation-record.json","paper":"/paper/2506.02864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T11:20:55.811097Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.811097Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:e7119784a7d80bddfb41e161b3962dea184befdd8393fee8e100097f5085124e","observation_id":"d0294f35-78d3-4939-b50c-55a588b1b7b6","resolution":{"observed_at":"2026-08-07T11:20:55.811097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:56.124539Z","title":"Aime problems and solutions, 2025 a","venue":null,"work_id":"3aae71d6-91a7-4336-b7ff-f9558b55577a","year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.816379Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:5d42d3c200a957b65976b97404598272a3a76966a939b140792ec4692d1f6a86","observation_id":"5bb22eda-c1b8-48e3-bead-b82e5b41d5f3","resolution":{"observed_at":"2026-08-07T11:20:56.129057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:56.111033Z","title":"Amc problems and solutions, 2025 b","venue":null,"work_id":"c8439989-a742-4312-a034-e7a4a6288538","year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.821455Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:2c62ee675714f403b56dcc4256844adb5efccddb454270e7b1a30872c8fa5122","observation_id":"4cf3e0aa-173e-432d-9620-05a096a9706d","resolution":{"observed_at":"2026-08-07T11:20:56.115926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:56.098269Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"bade83d7-497f-4f09-8692-232ad2a015c8","year":2021},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.826091Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:98de776cdd21c191bf7717410b8c678293c46e8388078554d2661a8e9c87689d","observation_id":"8aff3bcc-1730-4ccb-b064-900e97e15618","resolution":{"observed_at":"2026-08-07T11:20:56.102198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:20:55.831118Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.831118Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:8a5866d74e10b5e94f079dd7b64e591e5fb69828f28bdef2d33e9f4c361273e2","observation_id":"a3d766c9-e77f-4c17-9a74-f67746ab7989","resolution":{"observed_at":"2026-08-07T11:20:55.831118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T11:20:55.836739Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.836739Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:e573980d0d7cc8d33324a4bf5af3f76324be5debbaeddda5390b8b6b2b89416b","observation_id":"4e04a79b-5b7a-4e7b-97f0-cf4fb1bea277","resolution":{"observed_at":"2026-08-07T11:20:55.836739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T11:20:55.841916Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.841916Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:f0cd4b0911b4b0484780370263850f66a87096ca3ddd46f2f456d1f62aad2a89","observation_id":"a927a665-0fdc-42de-985a-abdf099b8613","resolution":{"observed_at":"2026-08-07T11:20:55.841916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:56.085414Z","title":"Buy 4 REINFORCE samples, get a baseline for free!, 2019","venue":null,"work_id":"d8c0036c-81e9-468a-bdba-ad0600f7c90a","year":2019},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.846031Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:6688adac86511f7a7f784c9f5b9b51da213dcb9b933694e6420658d211590d0b","observation_id":"5de13090-1d38-48ba-8fcc-448e26f3e692","resolution":{"observed_at":"2026-08-07T11:20:56.090147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:56.070998Z","title":"Remax: a simple, effective, and efficient reinforcement learning method for aligning large language models","venue":null,"work_id":"eb0b91e6-48e2-4722-87a7-df566d3422ad","year":2024},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.850087Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:1e91a62effece624b5939c7972f44f242885850e523977417073ebeee502c94f","observation_id":"4f0ba18f-0091-48a6-ad62-8ea5cfe1b05d","resolution":{"observed_at":"2026-08-07T11:20:56.077493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:55.854090Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.854090Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:e0bf48f74a594d7a469485fcd3b085caa4982ad968085e7240a5779ec16e4788","observation_id":"ddf762d4-f6a2-4d57-9851-b2fbc931dd95","resolution":{"observed_at":"2026-08-07T11:20:55.854090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:20:55.857749Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.857749Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:5a222a0efeed8df3092a95d943253848350b73265e5553ccb00055c076fbef1e","observation_id":"b169dba6-9989-489d-be39-f451faea0e9d","resolution":{"observed_at":"2026-08-07T11:20:55.857749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:55.862927Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.862927Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:ad868c5ca678248a42cc6ffd2237d3281760fbe08af26da8127d4459235d4399","observation_id":"1744213d-6b24-47be-9fbf-aa287f875d3d","resolution":{"observed_at":"2026-08-07T11:20:55.862927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:20:55.866604Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.866604Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:95bc83389a8845ee3547eb5e147f2ed11d8dbf9adab30af674d6a241735dc4c0","observation_id":"00bdef7b-6df4-4c50-8fe0-14e33526e5ff","resolution":{"observed_at":"2026-08-07T11:20:55.866604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:20:55.871831Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.871831Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:c398fc439e5ae8576e6eeb9a911516d099b474d98690f4143e29bb65453b16a1","observation_id":"1a3cc03e-4159-4fc3-bc86-9771e7e771c6","resolution":{"observed_at":"2026-08-07T11:20:55.871831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:55.875943Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.875943Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:e80a1305697a622ea6654d84c937e5bf6e4e97720eb3f696c76d79e5a50b2efb","observation_id":"849dfdd8-d8fc-4af0-924d-a6f58e89a1c0","resolution":{"observed_at":"2026-08-07T11:20:55.875943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:20:55.879621Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.879621Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:8c60779e2cb0db565dfdf46a31424c84af87b7852588801b6011316268a9e5f2","observation_id":"25fac9b9-e53f-42c0-9c0e-9378c7b3d8fc","resolution":{"observed_at":"2026-08-07T11:20:55.879621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:55.883608Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.883608Z"},"links":{"citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:0bc48279078bf0960c63e8fccfa211c0441b6d4a6ce56d9f5559c5bcc2ae270d","observation_id":"9c124978-7fbc-4b94-898d-225fdd9387cd","resolution":{"observed_at":"2026-08-07T11:20:55.883608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07246","last_updated":"2018-03-20T03:52:04Z","snapshot_observed_at":"2026-08-14T19:34:33.264400Z","submitted_at":"2018-03-20T03:52:04Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07246","snapshot_observed_at":"2026-08-07T11:20:55.887365Z","title":"Variance reduction for policy gradient with action-dependent factorized baselines","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.887365Z"},"links":{"cited_paper":"/paper/1803.07246","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:d79dfccf353271d803b5e08d68e722b0c1f25137e7e46b2d0416491872c96d2e","observation_id":"23278fa2-de70-44cc-a742-d0ec0fd671e4","resolution":{"observed_at":"2026-08-07T11:20:55.887365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:20:55.892782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.892782Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:df5c5b60ce143f7c9cb42ad23c87a0a4f121a6140d4c62e0a1742f666af98872","observation_id":"4dc3a996-6083-4363-92a6-930f3c91fae4","resolution":{"observed_at":"2026-08-07T11:20:55.892782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T11:20:55.897193Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:55.897193Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.02864"},"observation_digest":"sha256:c244172ae0a753c9c0a385a9de70760f5cba943e13613138f536eb2c1117802f","observation_id":"3ea6da40-e637-4f7b-8601-bd66849da427","resolution":{"observed_at":"2026-08-07T11:20:55.897193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 11 inbound Pith citation observations for arXiv:2506.02864."}