{"as_of":"2026-08-08T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b941b5d1a21a63e426933ddea7c7b87b83d39ad6f900da0802178ce300a0f6dd","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:00:04.018651Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:23.466690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.563954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T23:35:23.466690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.466690Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:22cf09e5e0d3b0d01c6d6cc5ac681809aceda5014980baf4afb6bfb686b3f370","observation_id":"4c754fc7-8981-4231-aa49-bfa42e2afe9a","resolution":{"observed_at":"2026-08-06T23:35:23.466690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T22:45:11.016827Z","title":"One-shot Entropy Minimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20877","last_updated":"2025-06-25T22:59:40Z","snapshot_observed_at":"2026-08-06T22:37:12.216691Z","submitted_at":"2025-06-25T22:59:40Z","title":"THIRDEYE: Cue-Aware Monocular Depth Estimation via Brain-Inspired Multi-Stage Fusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:45:11.016827Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2506.20877"},"observation_digest":"sha256:048bee2f4540f15d1c2fea02a5c155ae4f2f1cd87cd60a23efa313d5bae39faf","observation_id":"881e88db-a251-40ce-9704-853b60289a18","resolution":{"observed_at":"2026-08-06T22:45:11.016827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T12:26:11.136900Z","title":"arXiv preprint arXiv:2505.20282","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.136900Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:b2ce27acda49ccae0472abda0710dab94b34b6963b5bfd650ce9449492b3198b","observation_id":"43d43ab2-3aa5-49da-8317-3a3b660ecc44","resolution":{"observed_at":"2026-08-06T12:26:11.136900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-05T14:23:53.913129Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-06T03:48:35.615758Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.913129Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:4a9ef4298c161f72be4d871b528567dc829d2a80826c2971562a81a42904a3ee","observation_id":"72352bc2-0201-46b3-9b37-71dd8e686483","resolution":{"observed_at":"2026-08-05T14:23:53.913129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-04T19:28:56.841114Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-08T10:27:53.369430Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.841114Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:b958c8e0573f42a92079021eaaf782abcd7cb9ef62cc3bd75ef946d401a18196","observation_id":"596ef3ac-f757-494c-88ad-d727917f3bec","resolution":{"observed_at":"2026-08-04T19:28:56.841114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:f52ebeff9751b9a564ebbc966eb29c157bff203259e3e9954b6ce2122e4dd789","observation_id":"a7bad3a1-dcca-4979-b003-a142e7a21adb","resolution":{"observed_at":"2026-05-18T15:46:34.108283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-14T20:22:12.729190Z","title":"org/CorpusID:275789950","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18375","last_updated":"2026-07-10T23:41:27Z","snapshot_observed_at":"2026-08-07T22:46:43.471693Z","submitted_at":"2026-03-19T00:23:57Z","title":"Relationship-Centered Care: Relatedness and Responsible Design for Human Connections in Mental-Health Care","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T20:22:12.729190Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2603.18375"},"observation_digest":"sha256:6eb48ac7b62d797542f8aebfe4c6e0a48599362731d29462ef2d9193a1887147","observation_id":"a46c5b96-f8c7-43b3-9750-91915ed0bcb5","resolution":{"observed_at":"2026-07-14T20:22:12.729190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.12736","last_updated":"2026-04-14T13:50:31Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T13:50:31Z","title":"Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:00.241691Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.12736"},"observation_digest":"sha256:44219e41ac0db77e3991738f0168d3ef1e82189b83a906151d3a83e7b88a8da7","observation_id":"dc6f50a1-32fc-443c-b4c0-78c4f578d803","resolution":{"observed_at":"2026-05-11T10:41:04.634441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:b1d3e0e77b41230b80705c6e89155e52a59c1715aaafcbf3576e226dc5472a8b","observation_id":"17991fc5-8074-4b24-a417-d2f1b8ae79ab","resolution":{"observed_at":"2026-05-10T05:25:55.218273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.18003","last_updated":"2026-04-20T09:27:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:27:40Z","title":"SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:04:04.941107Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.18003"},"observation_digest":"sha256:d6c04008015553270378ad1af37bf489d073c85213872ef281158f173ec92a05","observation_id":"57adcbe9-771a-4d1f-8176-6e58f1eeb267","resolution":{"observed_at":"2026-05-10T10:09:08.620767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.19295","last_updated":"2026-04-21T10:01:04Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T10:01:04Z","title":"TEMPO: Scaling Test-time Training for Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:40:04.086809Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.19295"},"observation_digest":"sha256:676755cd0351939b847da38ff6a367556a4db4108ab2e85368e66c9390967056","observation_id":"491ffeb3-5399-4d0a-bdba-ec7b8e9fc6ed","resolution":{"observed_at":"2026-05-11T12:51:07.240388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:8568ac0e82abda7d7b4de4f4c6f7c93026c2af619937c0dc067d9226ad9b5778","observation_id":"9f6b2ece-7564-4e72-b83b-32db22f1f6b5","resolution":{"observed_at":"2026-05-11T04:00:55.342799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2605.08186","last_updated":"2026-05-05T12:00:06Z","snapshot_observed_at":"2026-08-02T05:15:18.309649Z","submitted_at":"2026-05-05T12:00:06Z","title":"Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T00:48:47.213681Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2605.08186"},"observation_digest":"sha256:c36acccaa040b99de66c5e0463d0b7ae1f728db11a404153d39c3d51480f5ce9","observation_id":"51ef5662-03e5-464b-941a-6202a389d6f2","resolution":{"observed_at":"2026-05-12T08:41:24.673769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:dae4926800389ebf923ba7780b49552aa87e288730cf4bd68286fb8f1db717ae","observation_id":"435b3f76-3273-44d9-9e93-76bbb75d8a1d","resolution":{"observed_at":"2026-07-01T20:56:13.355560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:bc645b470542e7c87fa42c3778427d0e047d4496d8b69dfba5b03cc0b5d854a2","observation_id":"2b142ae2-05d1-4a9e-bfb1-53ef1010a7c4","resolution":{"observed_at":"2026-07-04T09:09:43.565648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20282/citation-record","integrity":"/paper/2505.20282/integrity","json":"/paper/2505.20282/citation-record.json","paper":"/paper/2505.20282"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:00.965336Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:00.965336Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:3188a91d94ba787e0da888556ef9497b5f3392c385bba16cc394f9b8a698d440","observation_id":"c684cd86-0491-4eb8-95fb-bb4a6ab2d7f6","resolution":{"observed_at":"2026-08-07T14:00:00.965336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:00.986064Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:00.986064Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:87d0b0613b9c1b06edc20ba5ee74314f9053359c0a5499ff0ccf596c29edc45f","observation_id":"e4a3f193-0cf9-4bdc-ba4e-988585ab6de8","resolution":{"observed_at":"2026-08-07T14:00:00.986064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.726587Z","title":"Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Bıyık, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell","venue":null,"work_id":"1fb5d2ce-56ef-47bf-b765-978b8d10353a","year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.054806Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:59a2bbcd6f9c989c205e4d92fff1f533ac701bbcd6780099aa2fbefb0dbea42a","observation_id":"a95a396f-dea4-4c46-8a22-0230835b0dfd","resolution":{"observed_at":"2026-08-07T14:00:05.839135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.102138Z","title":"Process reinforcement through implicit rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.102138Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:0bc3730751f7596e896f22e0c5609753c9a442beebcaf135735903ad6496252a","observation_id":"3a07bc81-2a6e-4ab0-a5c0-8198cdafe87c","resolution":{"observed_at":"2026-08-07T14:00:01.102138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.426876Z","title":null,"venue":null,"work_id":"e2954a41-21e2-44d9-8316-e910b9af749e","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.166182Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:eac5c1219e04255399794993af64373fde3b4adde2d0eb2e893469e3b3888241","observation_id":"42dda982-470f-4c9b-bf9d-4992cc052fbe","resolution":{"observed_at":"2026-08-07T14:00:05.556666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.245249Z","title":"Interpretable contrastive monte carlo tree search reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.245249Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:de59e1d952b5fd285395dbb6ebb7a8978ed5f6b4d9ca70ddabf3bf2ee92ed5ed","observation_id":"b8dc0b44-98dc-4fbe-9f3a-6c8f2bb0741b","resolution":{"observed_at":"2026-08-07T14:00:01.245249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.155756Z","title":"Mixed preference optimization: Reinforcement learning with data selection and better reference model, 2025","venue":null,"work_id":"ed698b90-86e3-4074-bdb7-f2f208ad5f94","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.280847Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:d41356350d5e1f294738e10c83ca39fee522dc40bea881fa4752b3eb0a478371","observation_id":"e67606fe-d368-43d6-818f-14ece745f27c","resolution":{"observed_at":"2026-08-07T14:00:05.254551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.363469Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.363469Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:da84d8841459c4602a08e6b160ea835037eac46c3bdb7a8e7ea2c0156d06fc76","observation_id":"6fec6666-3639-4126-b301-2700ec07e3c8","resolution":{"observed_at":"2026-08-07T14:00:01.363469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.426637Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.426637Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:3ca6c8b91e35b4d7a1afc7f4ab42a44d3accc7dadc48427cd4882057bd802054","observation_id":"9766c71c-6604-4d11-b589-0736c0a59b0d","resolution":{"observed_at":"2026-08-07T14:00:01.426637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.545993Z","title":"Reinforce++: A simple and efficient approach for aligning large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.545993Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:9bc066b1310d614bcf3ede54c1673828630b1ad0301a202c13184955fd0eb180","observation_id":"8b922226-020b-40e3-9e93-c9e6b7e53bb6","resolution":{"observed_at":"2026-08-07T14:00:01.545993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.668419Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.668419Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:a51de0ddc04d3157814494fb88b7286ca3fea663f09154e67a92b978a012cb98","observation_id":"b765e25c-b272-4d62-9c67-623b504bcdb9","resolution":{"observed_at":"2026-08-07T14:00:01.668419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.772374Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.772374Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:bea4e3b4d313fcbc3588a770fb901cfc7f41c438b7cf7177997aebdbdf844581","observation_id":"b39f15ba-6895-4345-9b8d-2d6431c914e6","resolution":{"observed_at":"2026-08-07T14:00:01.772374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.861831Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.861831Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:7367b79a57371e5c9d09d8f4335c111d5b0567e9954198b3c19942a7ccca5a28","observation_id":"9f8531b7-91ad-4f83-b3c8-f6b0ee3fd4d2","resolution":{"observed_at":"2026-08-07T14:00:01.861831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:00:01.988637Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.988637Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:280e2c28b562bc3b2db4b6a61c9065483f50a6284187b1f756f37e22974dfa62","observation_id":"f2137447-de90-4943-8098-d810c46ec7d6","resolution":{"observed_at":"2026-08-07T14:00:01.988637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.104088Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.104088Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:ae56f8927d666c49940a32fafa9c5f0612aa93bf7c1cba430e532af8498f00f7","observation_id":"63073ceb-54a4-4927-a2a8-6e3ba697d05e","resolution":{"observed_at":"2026-08-07T14:00:02.104088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.257146Z","title":"Introducing openai o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.257146Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:9fad5d1b4affb9ba179c99f0aaa22ab58d8318054baf61ffbec01682d218649c","observation_id":"c0f32483-2e78-480e-a2f4-719cada52967","resolution":{"observed_at":"2026-08-07T14:00:02.257146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.804928Z","title":"Introducing openai o3 and o4-mini, April 2025","venue":null,"work_id":"0b978bbf-6b94-4bc8-abdf-4bb172eba311","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.379106Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:af081e9d726fd95e523052fd5a3fdc9f12dc9d71c60c9e6d3088dff6b51199fe","observation_id":"b58c0e40-63af-46ee-b959-f8d146d415fd","resolution":{"observed_at":"2026-08-07T14:00:04.958398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.516302Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.516302Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:2fc64b54b839e256fd9a98d1283b9660b262c34803f63598c893be6cee10c060","observation_id":"d6b42aab-48a4-4a57-be82-b52df24a7b10","resolution":{"observed_at":"2026-08-07T14:00:02.516302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.670448Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.670448Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:fb6b26468fb0da401ab41b04f2814be9d7f0b9e6f9806dfe456a295a1cfda988","observation_id":"99dc841e-745d-43eb-acbc-cfe6b83a565e","resolution":{"observed_at":"2026-08-07T14:00:02.670448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.783413Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.783413Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:d082b56a330acf99b7c1f391c8ff27d00d71c27853df8bcb076ec8ce32d7aeff","observation_id":"4a49c8fb-eee5-461b-8ace-0d3b6a0d57ff","resolution":{"observed_at":"2026-08-07T14:00:02.783413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.976908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.976908Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:ab5b1c2b5c125e9b1fb324b59894cd32290bcbf2c940b3d130b3148148ae24ca","observation_id":"380c4873-a384-4d53-9d23-33dd185fb90b","resolution":{"observed_at":"2026-08-07T14:00:02.976908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.163516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.163516Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:66abfb65b25269cd77cfdd82bb6e209bbc23460aa4d108e5a29e75a25cb85b9d","observation_id":"50cb3015-10f7-4dde-984a-962aa8ba4b5a","resolution":{"observed_at":"2026-08-07T14:00:03.163516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.293586Z","title":"Reinforcement learning for reasoning in large language models with one training example, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.293586Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:46f93709bbb47878524c8f61ec00e390797f99ccd62a92c25c3b7040063bbe5b","observation_id":"5cbfd56f-65c5-4494-90dc-7a97648f838f","resolution":{"observed_at":"2026-08-07T14:00:03.293586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.474091Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":"728d79a3-8bea-4b82-ae14-31fde5eb5adf","year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.410913Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:f4cddf4ba804b0003fb66f5f69aa660c6e5764c6467f33828633a10049185386","observation_id":"27853730-a5ce-4d70-8821-b5b49ea5b3d4","resolution":{"observed_at":"2026-08-07T14:00:04.618222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.557524Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.557524Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:d16e6a17980686128cbc75bbfd448c202181fd88a34ff1dde5945c4833f9c125","observation_id":"3956a355-01cf-4690-a333-cc63d9648b98","resolution":{"observed_at":"2026-08-07T14:00:03.557524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.743721Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.743721Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:baa696669d9cec73c8cabe0cd6ef2f3ead6996e00d152c5ad4ec2db69f5d4cf0","observation_id":"07c8ef16-87cf-44af-9b98-0391ea31b4c0","resolution":{"observed_at":"2026-08-07T14:00:03.743721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.880396Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.880396Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:8a907b821c4bafde45d9b57b891524200efca3327c4950241a71d506682b6cc7","observation_id":"d6dc3434-764f-4e1c-a924-052e782cbb49","resolution":{"observed_at":"2026-08-07T14:00:03.880396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.203932Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":"dc23545e-318f-45ac-9be1-6edf232c4e6b","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.018651Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:b20bf2c082092f5aa9ce133905a0612f36101b309e770cd5256bb4d9deb0ef63","observation_id":"a6f37e15-a6d9-4694-9d98-8a9b0357e692","resolution":{"observed_at":"2026-08-07T14:00:04.302387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 15 inbound Pith citation observations for arXiv:2505.20282."}