{"as_of":"2026-08-15T00:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a77d1518e36f7240c1499feb2b37d2570041dc26eda6f842c62fdcff24495ff","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:30:37.685873Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:44:41.612646Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19461","snapshot_observed_at":"2026-08-04T13:44:41.612646Z","title":"arXiv preprint arXiv:2605.19461 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-13T06:02:04.863233Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:41.612646Z"},"links":{"cited_paper":"/paper/2605.19461","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:3d4f6e064cb172a614581f995c0a7a9abfda818cfe12946116dfdb5c7a619159","observation_id":"50d1c619-e285-4906-a690-0e82a7612cc1","resolution":{"observed_at":"2026-08-04T13:44:41.612646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19461/citation-record","integrity":"/paper/2605.19461/integrity","json":"/paper/2605.19461/citation-record.json","paper":"/paper/2605.19461"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the impact of entropy on policy optimization","venue":null,"work_id":"23420652-eaef-40ab-8588-4d6c2e6fccb0","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:56af028ce3887cf530cb651683bc0497ca5fc324b3793c037622d7eb5472d816","observation_id":"a37149da-5945-449b-8037-3c350e66a895","resolution":{"observed_at":"2026-05-20T05:33:05.601105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025.URL https://hkunlp","venue":null,"work_id":"85f6eb5f-fe0e-4ffb-b667-dad3a496ef1c","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:220741bdcda8853672bd153b07ffc01494b3080df38fce00807272acade20392","observation_id":"ee34dfb1-2691-4ddd-b20f-5f2fa4192de2","resolution":{"observed_at":"2026-05-20T05:33:05.597935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:c25b1847c5ff6284fcc9ad25e43132713e9b15e6f1c7a67fa765b2cf534b59a6","observation_id":"f59bf4b1-8ec5-4235-97f3-aa03cecb0ec4","resolution":{"observed_at":"2026-05-20T05:33:04.021456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:a1530c5413a37d4d453387e33e1d7157e35f038d777c03d6c6a06f7247f880ca","observation_id":"f26dcbd3-d925-49b1-91fb-13e1c3be1936","resolution":{"observed_at":"2026-05-20T05:33:04.068835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:1cd7c067ec8bf5718b6946360b7b89d4f50c16b56385b51a45b9738cf78f4562","observation_id":"855b7f33-2cc5-46bb-989d-4125447dd987","resolution":{"observed_at":"2026-05-20T05:33:03.991294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning","venue":null,"work_id":"e3b5d9f1-644a-4096-8353-c8c6d277cf31","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:c579a353ced8f314b1f5fe767175018c7108292b334da0a87616f0f2c8622321","observation_id":"198d6157-fedf-4cb0-819d-79406df5d440","resolution":{"observed_at":"2026-05-20T05:33:05.594731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:8d8eeb36b375aade0d2fa23195e8832f3b5c35f130d123ddf494486fad7e5edc","observation_id":"9e7027c3-6e42-49fb-a302-4a5ee8dcefaf","resolution":{"observed_at":"2026-05-20T05:33:04.056176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-12T23:21:07.520817Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":"2407.11691","doi":"10.48550/arxiv.2407.11691","metadata_source":"pith","pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":"cs.CV","work_id":"c639e7fb-11f5-459a-8942-659daa5ac1d8","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:fe538732b6751c2fa8a602afcf42befca73b62adc754a1ee389226952cbdd1b1","observation_id":"9fb821af-4b1f-4227-9b44-71bb0591aa1a","resolution":{"observed_at":"2026-07-07T02:19:36.652705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The wisdom of the crowd: Reliable deep reinforcement learning through ensembles of q-functions.IEEE transactions on neural networks and learning systems, 34(1): 43–51","venue":null,"work_id":"d1e98588-699a-4dd1-8b68-56febe74dd9b","year":2021},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:8a08f901ed7518a2a21defb120faaf803fc8772d76a000cfac3fa2b769e5fefb","observation_id":"aee1cd82-d8e5-4928-acd7-a3b9264ea894","resolution":{"observed_at":"2026-05-20T05:33:05.591804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-08-14T14:45:24.227476Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:2c3bab393ab85bdc1e7c35002b7d41100f9f77b4ca4755b6be2655126085578c","observation_id":"94f56815-2179-4fda-b097-666a5c0f1000","resolution":{"observed_at":"2026-05-20T05:33:04.118658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:9a314992d4b0010032d511e21fc52a5f6c6980499a43b5284904b418e914f932","observation_id":"ba146b9a-fb39-4699-9f3c-983e3f2de9de","resolution":{"observed_at":"2026-05-20T05:33:04.081794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"095da609-8439-433b-ba0b-fd625932f275","year":2018},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:afe0df715e6f2292669d0bf3a5564399772e59f35c133714813768c0af1de5ab","observation_id":"5593c69f-5f37-4134-9fbb-beecd225756f","resolution":{"observed_at":"2026-05-20T05:33:05.588286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad- level bilingual multimodal scientific problems","venue":null,"work_id":"dbc0a432-2433-49bc-b5c3-11927440cc5b","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:46334655b181f1dd72d69347675ab4cf2d1883090c31b02a4dd7f7c949e30efa","observation_id":"996b206a-da57-4a82-96d4-76d61d3b06b1","resolution":{"observed_at":"2026-05-20T05:33:05.584772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:b6f9bae272059184a5eb3ee4d79b44a1140bc223870d398400c18b23ae5cff2a","observation_id":"e4b2e5c6-750a-41d0-b97e-86ef77a03cc4","resolution":{"observed_at":"2026-05-20T05:33:04.086260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:e1fc7d8bb2e43809ba0b0d5f4ca797ead4a28c7cc51b941620c6b1a933484bb6","observation_id":"c7a737ee-6be7-4a96-8976-61d0c7cdd819","resolution":{"observed_at":"2026-05-20T05:33:04.064423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":"2510.14901","doi":"10.48550/arxiv.2510.14901","metadata_source":"pith","pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","venue":"cs.LG","work_id":"56a35230-70da-4209-8bd7-899023fabb1b","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:1a64671bd3f61814d926479cf186e03a3e2c785a43c986819b0682c34ac4bbc8","observation_id":"2982cfa8-3cc6-423d-aa44-00a24670bcdf","resolution":{"observed_at":"2026-05-20T05:33:04.016736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":"1805.00909","doi":"10.4249/scholarpedia.1658.url:http://www.scholarpedia","metadata_source":"pith","pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","venue":"cs.LG","work_id":"e29031ac-37fe-4702-86de-bb869d1f5c9a","year":2018},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:809de393fe4ad457312346a2048fdfb5399a6e91b920fd00ae7ad6a25688f016","observation_id":"d6033ec3-5866-44d2-af1c-4b9cd44001d5","resolution":{"observed_at":"2026-05-20T05:33:04.090399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models.Advances in neural information processing systems, 35:3843–3857","venue":null,"work_id":"d4bddf88-fd06-4191-a3d4-f52c99a3fa10","year":2022},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:326806221a4f79a174f9a5bbd4ff95cff574bd65b7f1ca393bfdcfceb7092e7d","observation_id":"673c4f78-4532-41bd-9f03-0a659be9cc2b","resolution":{"observed_at":"2026-05-20T05:33:05.671215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13(9):9","venue":null,"work_id":"cdeac8b3-70bf-4c60-aeb5-91c23aeb247b","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:9b556e51b56eecfa32fef2992498ba2e9a99b5f04eb1c475a3f0d5c4794c4131","observation_id":"07474a42-a595-4c3a-a7b4-b8e87a465d9d","resolution":{"observed_at":"2026-05-20T05:33:05.663789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16476","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:51.934482Z","title":"Np-engine: Empowering optimization reasoning in large language models with verifiable synthetic np problems","venue":null,"work_id":"0d4196f4-9500-4a89-9df7-bc54e78c9392","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:dc70d11bb6ca97bd4ffa3f8b3b336f1f35dce6704afba857c4230f67f3d878de","observation_id":"1e5d71a7-118f-4da1-9caf-3f700cd78a3c","resolution":{"observed_at":"2026-05-20T05:33:04.047367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code-r1: Reproducing r1 for code with reliable rewards.https: //github.com/ganler/code-r1","venue":null,"work_id":"db2f61c6-b674-4963-bfcb-fe5c7263717a","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:9d81c67498d7000b2282344c213bba3554cacfc9701516d52c42d2c9fbb6e6df","observation_id":"a1cf41c6-6992-4289-ab73-206ba9f953dc","resolution":{"observed_at":"2026-05-20T05:33:05.667387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:47ce497140886e6c4b7846b4eacce314c3dd33981e9e8fb6d3e125c81cc1d00b","observation_id":"961bba6b-e9e6-473a-9bf1-4dc9fdec77dc","resolution":{"observed_at":"2026-05-20T05:33:04.031679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:a2a02dac4dbda9e3706896cb4404be4128c9982f4dcf39a0af0e5d25a400b3ad","observation_id":"e7c77d9d-0b59-4783-9f93-7b21d5ab3875","resolution":{"observed_at":"2026-05-20T05:33:04.122817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press","venue":null,"work_id":"2971343a-e3da-43cc-99d6-22f016b20878","year":2012},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:bb63cd6ffa6a50def2233a5bb0242a446e9ba15e02175417fab39d8d67a2c62c","observation_id":"fe78bcd9-bc74-4a87-8644-ce3fc96213af","resolution":{"observed_at":"2026-05-20T05:33:05.656937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms","venue":null,"work_id":"29b8fdd8-f731-4d7b-9b9d-8666c45da139","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:21f9cf2c824aee595470089b661c9980091b688f6291130043389a81f66cd22d","observation_id":"176119b7-7781-42e7-8780-657ba4648c1a","resolution":{"observed_at":"2026-05-20T05:33:05.660170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"21a3780d-6536-40fe-9a98-87c947b24729","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:afb2bd7e82e2c9f436664332d1a6087248155c2aed898e601a2e6cf9269a0021","observation_id":"f47a157f-b509-4cc3-af1c-faa3376a8d53","resolution":{"observed_at":"2026-05-20T05:33:05.654018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:ba49441d964279900ef20a4b278e2b89becf0e785650dd008f706db99b26aad3","observation_id":"c92bc789-91d8-4a64-875e-18b7adc9210b","resolution":{"observed_at":"2026-05-20T05:33:04.012348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:f0d7a730bed1d97467f3b850b505d06eb837ac3be8a1f3d9e936ceb07e268b58","observation_id":"23c91af2-ac4e-478e-92fe-d98de2318a3d","resolution":{"observed_at":"2026-05-20T05:33:04.108660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:fd6de186d991b06798928126bfcbda006a61850acdf3388c5b36969222c3a131","observation_id":"1078e265-29d0-45c8-b017-efcadd510dff","resolution":{"observed_at":"2026-05-20T05:33:04.112833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:6be271e0f4a4d970cc4103d2584477ff19efa2739525629dd68bc424501ab8b8","observation_id":"15b83eb1-f291-473d-bba4-8dbfa2f28860","resolution":{"observed_at":"2026-05-20T05:33:04.041635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing language models for inference time objectives using reinforcement learning","venue":null,"work_id":"7972133a-8083-48f9-8080-14fa65199b07","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:cf014e816bdfa677e82f083c1e16a0871db52193344dd4cbc2affce04f0b19da","observation_id":"dba45ee3-86d2-4417-ad9d-c2477fd67baa","resolution":{"observed_at":"2026-05-20T05:33:05.650679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:57f93815874a2de7bfcc00dcf831db2eb5c4407002d89e29183238a45b400885","observation_id":"8dd7e67c-5999-4c1a-b923-ca085a9a060f","resolution":{"observed_at":"2026-05-20T05:33:04.051732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-13T06:08:42.070209Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:654105765ed385f83d835a6786991a6da4ea6e5d803e1e24475388d97387a67b","observation_id":"1be689d9-7961-4844-ab19-a6c50b5bf41e","resolution":{"observed_at":"2026-05-20T05:33:04.036499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":"2407.04973","doi":"10.48550/arxiv.2407.04973","metadata_source":"pith","pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","venue":"cs.AI","work_id":"d1811506-9b67-4c64-ae5a-4abeaaec10f3","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:4f4d8e1ae1f2b408454323b5ae0c7e7a084a36a89240e449a55896d958592086","observation_id":"b47dfa66-c124-4608-b0a8-5199c4e720f8","resolution":{"observed_at":"2026-05-20T05:33:04.001110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.492625+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.492625+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.15279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-07-08T23:55:43.050247Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":"cs.CV","work_id":"a380ccb5-e994-4933-b73d-d8df0105e038","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:7a16ae55c24da82e8b2f00c81b091e19882d5a3e539fb89053d983732d7793df","observation_id":"fef7c5a0-c800-4b7f-a87b-98943088211d","resolution":{"observed_at":"2026-05-20T05:33:04.007594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:6840f42457117ad9685e48f2509c61d9adf2312c8dbde2d36111fb48155a2cf0","observation_id":"63531d10-d0f6-4cf0-9a84-779f02d90597","resolution":{"observed_at":"2026-05-20T05:33:04.099464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:bd6fc27ff53c9ba55749ce3ee6377a8fb74a0db5633b916f3b42be0b75a7dc93","observation_id":"ee67d419-e0f3-4d98-b205-91f6b46cc74c","resolution":{"observed_at":"2026-05-20T05:33:03.996643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsm8k-v: Can vision language models solve grade school math word problems in visual contexts","venue":null,"work_id":"cea63a00-e658-43d6-a4fd-40ced0219b48","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:7972791b1d9d9c8485618cb745bec2efa2f514514512bc6e8fb851dd3d02f9ed","observation_id":"e404842d-b91e-430d-9adb-c11a81ee5935","resolution":{"observed_at":"2026-05-20T05:33:05.647003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:642dbe327962597f0ef1b5003a51e0ae28ef1dde2a5930836d9281fa37d4b405","observation_id":"dc596150-cdd7-4588-8345-fb400c460094","resolution":{"observed_at":"2026-05-20T05:33:04.104438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2509.08827","doi":"10.48550/arxiv.2509.08827","metadata_source":"pith","pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"7618c14b-e527-4268-9926-d4f462ea9925","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:f4afbdcfe5d0e0042f61e9d8b82cec74828fb49b2fb13438ff5f0bd69b4fe3fb","observation_id":"2f1b12f2-1d77-4814-ac5d-2c98432bcce6","resolution":{"observed_at":"2026-05-20T05:33:04.026272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:2a0ac19758a38cd854a6f644606f1e89ac1b1a3e5b603c7ea899d06dbb148fef","observation_id":"39086b19-68a6-4dce-a81a-7315074d582a","resolution":{"observed_at":"2026-05-20T05:33:04.128010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:7626f2e4428aabae738b9aab90b65cca6da8aa28b400da5156f42c58dbe53eec","observation_id":"7c2d8b3c-581f-4362-8d30-09258c08b9fc","resolution":{"observed_at":"2026-05-20T05:33:04.060488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:55.532712Z","title":"arXiv preprint arXiv:2509.15207 , year=","venue":null,"work_id":"792e6e52-d465-4464-9da0-4747d275548d","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:9089a45d3c084eb83fc64ba39b7d173d2103263c20d3b53567ffe9a113606e6a","observation_id":"1cc36a5d-3d4b-4452-a1ea-8e3bca7e9976","resolution":{"observed_at":"2026-05-20T05:33:04.077836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.394004Z","title":"Exploring multi-temperature strategies for token-and rollout-level control in rlvr","venue":null,"work_id":"176f10fa-68a7-4fe9-a839-87a35639a826","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:3b5494bf6841fda2c408e1cdf968bf0469a57aa920154a9d9273a3ffea15e791","observation_id":"759f428c-1e07-45e2-999d-5d22141af381","resolution":{"observed_at":"2026-05-20T05:33:04.095284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensembling diverse policies improves generalizability of reinforcement learning algorithms in continuous control tasks","venue":null,"work_id":"95a49377-8c95-42e6-8b18-02861ecfc9e3","year":2023},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:adc50d6c3a5e6cb28eeea5bfe27b6aa7109083ae9088ce5afdeaa8a9c94abb7d","observation_id":"0f112f74-3b3c-407d-bf6a-6d6782d28e21","resolution":{"observed_at":"2026-05-20T05:33:05.637569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Find the shortest tour visiting all 20 cities exactly once","venue":null,"work_id":"a9488d45-4470-47ed-9b8b-1043aab21192","year":2008},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:8a8c5fc785352864b68d5ae7656b15c760fdffab578052f8b5aa7d46bf4cb5a9","observation_id":"ad70caba-4c0c-41be-bec3-9a38537e6efb","resolution":{"observed_at":"2026-05-20T05:33:05.640943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"optimality gap","venue":null,"work_id":"93fe7edd-59ac-4caf-b3c1-b6009131a8a1","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:de21891eb2f5cdbf7f3b06dc3972db161c652670d9ffa20c2d4f10a0aea6716d","observation_id":"c1564609-ee29-4f4b-98f1-898537bd9e24","resolution":{"observed_at":"2026-05-20T05:33:05.630453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0ea9e8a-acc0-4c18-9ebf-e65f885ec7c6","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:9ace7ed6be7ac74c60c65f9fc9855e239d1d65da91e63d7f3dd0b529b091f293","observation_id":"237ab1d6-a4bd-4dfe-9002-29411ec028a6","resolution":{"observed_at":"2026-05-20T05:33:05.621269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1b8bac63-5e3b-4329-a9ed-d3ecb5c05b6c","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:26ff5946d2fe9583d1e9b5c5d01346dc8d453a2f3bc89626c3df0b5774214699","observation_id":"c5c4d44e-e35c-49bb-b7da-0792def75f68","resolution":{"observed_at":"2026-05-20T05:33:05.618757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ac50c82a-87a7-4de3-8e80-8af8bc7d3a16","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:00709001fa83b69760f256f697e610496821befdbae6ddb43be8c7f80bd9d15e","observation_id":"e5779b26-c5b0-4b6f-8792-3074b3de4e3d","resolution":{"observed_at":"2026-05-20T05:33:05.624423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let's start by assigning colors step-by-step: - Vertex 16 has the highest degree (5 edges), so it can be assigned color 1","venue":null,"work_id":"7d126553-4105-4e6a-8ac9-35c12dcf8607","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:158e4aad79a15b86e1ae922d4052db419e68b878f3eb69bdda354aad897fd20b","observation_id":"6c2909fa-e0e9-4fa0-b174-1926dc6bfc69","resolution":{"observed_at":"2026-05-20T05:33:05.627296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3badffb6-9be9-4ee9-b8e4-464c6b333ac7","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:6a1dc6c2efce0187ce245634949605625bcf39f176faa287451504f10fcf8d94","observation_id":"4dc56c6c-b217-429e-966c-f1b12f219d7d","resolution":{"observed_at":"2026-05-20T05:33:05.615926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"331be725-1342-4ecc-ab59-2f20a2a1c822","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:1a924bca76184600a3ba51608e9aac2b458dc5ccd23fee4147b1bced1c6d723c","observation_id":"0a05bda2-ebd6-4af4-9f76-cd5a2522bc30","resolution":{"observed_at":"2026-05-20T05:33:05.613041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc34e782-6dfd-4774-84e6-a38e3d9c19c3","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:59782a873f68d0a57e24c949eac66434803fe78cd4d86179f0ec8484fe194b90","observation_id":"64c0e413-8c6e-4c34-a63d-52f516591de0","resolution":{"observed_at":"2026-05-20T05:33:05.633346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62e9c2a9-aaa5-4618-a8a8-6043bf12c5a9","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:be0c61513c9b2b7fae45736fa56fc38a23eaf3c5418ebd7355a6d4630ad0b9c5","observation_id":"605fadf5-dc62-4672-b163-fa2366c7943c","resolution":{"observed_at":"2026-05-20T05:33:05.644068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e61a60b3-21a5-4d78-b175-b5b83e982df5","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:ab27a7ab4a3582c1ad3af4586aa6c27197f9966ed9110645782f5df7b842bf47","observation_id":"22b5469d-7aa9-45d5-a520-ffc9ef9d7d35","resolution":{"observed_at":"2026-05-20T05:33:05.604110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let's apply this to the given graph","venue":null,"work_id":"be359f97-8c29-4c0a-a8ac-3617fa84a00b","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:b5ce6a9b962eca8699443859be3d79078d6236c496b39a35d41753ff3d0dbe8c","observation_id":"089727e6-8204-487e-bf50-c5796967617a","resolution":{"observed_at":"2026-05-20T05:33:05.607139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f684e0a1-1d6a-4f11-946e-5007f035a39b","year":null},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:2788c6b5b9f384ee3f50f47d6a134212eff04ddf536d5058481151623b8a8fef","observation_id":"67869dbf-dc5b-4f94-95cc-834aa8a486f6","resolution":{"observed_at":"2026-05-20T05:33:05.610168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":29,"verified_fuzzy":19},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2605.19461."}