{"as_of":"2026-08-09T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a65f830aba0584021a27980b2d79d92cd1ddbe61192cb47e9e9f051bee3e613","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:25:34.637803Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:48.791895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19436","snapshot_observed_at":"2026-08-01T13:52:48.791895Z","title":"Cepo: Rlvr self-distillation using contrastive evi- dence policy optimization.arXiv preprint arXiv:2605.19436, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.791895Z"},"links":{"cited_paper":"/paper/2605.19436","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:29e5bad4db098f44bcc201f34cf87a7bf4d59bb284f1cf1be7996a869b4c87e5","observation_id":"e331cbeb-d053-4a43-b835-8a72ecaea650","resolution":{"observed_at":"2026-08-01T13:52:48.791895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19436/citation-record","integrity":"/paper/2605.19436/integrity","json":"/paper/2605.19436/citation-record.json","paper":"/paper/2605.19436"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:d705f482d2619927566ea89db516523c89a444ef6c44905fb3a1f60178da6327","observation_id":"cd16c89e-b10c-4460-8175-6f7dd9798967","resolution":{"observed_at":"2026-05-20T07:28:06.692342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing reinforcement learning with dense rewards from language model critic","venue":null,"work_id":"597b2c7a-c559-4766-a392-05f314659475","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:4da68eb91265bf8197004fffc010fd901aa04712482dab72a0b3333c346a7397","observation_id":"9f7f6f2a-cbd1-4c62-8605-8652dff3c5b9","resolution":{"observed_at":"2026-05-20T07:28:07.789041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:12.711972Z","title":"Hdpo: Hybrid distillation policy optimization via privileged self-distillation","venue":null,"work_id":"e40578ea-e2a1-4ab3-a681-c6ee0356fb90","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:c67e556025ae680705408c2bc032df20320c81ed9bd99d7f7b903ca2b1eb862e","observation_id":"de406f7d-30ce-4ab4-9bfa-dee53628e503","resolution":{"observed_at":"2026-05-20T07:28:06.732172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:cd791c5d30d2bb952e4d016a0ee4fb54cb99aafe92ed8c161e32eafeb35a71d9","observation_id":"49e1f607-f397-46ee-be6e-07acc6a6a873","resolution":{"observed_at":"2026-05-20T07:28:06.715382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:09:43.530437Z","title":"Segment policy optimization: Ef- fective segment-level credit assignment in rl for large language models","venue":null,"work_id":"c65cb5ef-2355-4a2d-8c67-89582e550b43","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:5db9bdd78a52179d3528253b7780ed6e4a0a7ba4fc4c9ca45fe0180414dfd317","observation_id":"3bba8b69-66f5-4828-818a-8142788905ab","resolution":{"observed_at":"2026-05-20T07:28:06.696139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:eeda5f5e89547d7451e05690f0425bbd9ea99f0b43251f967fc33d3648b10fbc","observation_id":"bfb0cdab-fa69-4677-b91b-e458441e5908","resolution":{"observed_at":"2026-05-20T07:28:06.740802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vineppo: Refining credit assignment in rl training of llms","venue":null,"work_id":"a09060cf-9f15-4538-959d-7237ba661637","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:98ea4068c5419bcce02901df165a8785a348e2426babdd0bb57c98941f7471fb","observation_id":"d41cce22-37b6-41db-8958-43dea5070073","resolution":{"observed_at":"2026-05-20T07:28:07.806585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"901f88db-4f41-432d-84b7-a29c811d1a5d","year":2023},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:12246cc264c377588ec9a6fc95e05e8eae65239e0c0541fe0cd0318d6567c36c","observation_id":"f752aaaa-ec60-4f3c-8bca-5ec713ef0259","resolution":{"observed_at":"2026-05-20T07:28:07.803751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.560761Z","title":"Let’s verify step by step","venue":null,"work_id":"1e1d0751-e17d-4e3e-aa61-95245c4f49c8","year":2023},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:8a096a31f4c5328276b4e1742ca5e821dc4e49e759b12779c652eff4a638bdec","observation_id":"fb9b350e-582e-426b-b3b5-7c252a10b441","resolution":{"observed_at":"2026-05-20T07:28:07.801519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:965e3d358e6eb0f9e1a80f65ff022dac52268ceb302f05db08a5bd11b5ca8a8c","observation_id":"9437ccef-8cb4-4beb-b315-9edb91f04ed3","resolution":{"observed_at":"2026-05-20T07:28:06.743892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"5d5ea0ad-8b95-40d1-8203-c7cd057ef99c","year":2021},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:f0d51467c2f87c67a6e2b5987e4092805020780bd803f410a5aa6aa36ccb657b","observation_id":"ef5f2040-11c3-4095-ad24-8bf13606edf0","resolution":{"observed_at":"2026-05-20T07:28:07.808483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:dfe1fabfc58112ec49ba238939934f954700e820b00451f96ef65ff277274a9c","observation_id":"e0793516-e4ec-483a-b45b-b9f87305e1cf","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"25d1c515-8898-4c03-ad26-33c59fe7f6c0","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:576b1b6573b2dcdfaf36b282ab0208346960a26d9182515b750f193364076e27","observation_id":"6b6b04f9-7334-44dc-8466-e12506ac3660","resolution":{"observed_at":"2026-05-20T07:28:07.810293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"f730b5ed-87e2-4dda-9e5e-e0f3f33405f0","year":2023},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:7f1562ea5659a40746a4eaf24e3d28d220567ca49a0289bd5f5409126053fb58","observation_id":"813132db-5d51-4a2d-8414-50ecf1838102","resolution":{"observed_at":"2026-05-20T07:28:07.797670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:baf1f3c3df997cf3a080abe6ea66a83186c307216b2443ffac0e757723dbaaac","observation_id":"3653660e-4cd6-40b9-8842-ee81e9705f96","resolution":{"observed_at":"2026-05-20T07:28:06.712482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2410.08146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-07-04T13:59:51.893694Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","venue":"cs.LG","work_id":"441f2f86-f865-4551-88a5-52267f220c59","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:b7817f18a06382ffa9ef316ee1c55082d3a257060593be65e61a3c774bfe6992","observation_id":"c424760a-73d0-4362-8a38-f3972fd3a327","resolution":{"observed_at":"2026-05-21T01:42:19.263401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:a2eee3f82ce2b64ebb53ddc362e0db665ba8b2af58e91d012a08fdc97b7232e7","observation_id":"74ae5e96-c6ca-4e43-9f32-8705243c0aad","resolution":{"observed_at":"2026-05-20T07:28:06.699451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"16655dbf-d65e-4eb4-8b52-060a6cb68779","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:453b5d3d60c24a1ba7d3847fdc7626de0c18b47c55ded5b1395d59c8c23250bc","observation_id":"49ba4685-b6b3-42f3-8f79-ec2a17ab8e83","resolution":{"observed_at":"2026-05-20T07:28:07.792830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":"2407.04973","doi":"10.48550/arxiv.2407.04973","metadata_source":"pith","pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","venue":"cs.AI","work_id":"d1811506-9b67-4c64-ae5a-4abeaaec10f3","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:d1b2cd9ff2bf9c00dd1538d869c2385fcdc685c4d01063169320a04d7398bb23","observation_id":"1dc53f8c-65dc-4127-818e-bb63134e56ae","resolution":{"observed_at":"2026-05-20T07:28:06.738133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.492625+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.492625+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:1cb8ca577bc85a2a6fd7b378cbfec3c4a382ec96a1e16232c4d20f6400e0efe0","observation_id":"c6c886dc-109c-49d2-ab17-458f03f002c4","resolution":{"observed_at":"2026-05-20T07:28:06.735030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:c105526036613f1430abfac1099620b25c820fa198f4999375e43bdba7833a1c","observation_id":"f4444fb1-8423-45b8-915b-697e7349ccef","resolution":{"observed_at":"2026-05-20T07:28:06.709083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:57bf83d47d1f0e1da2d27fb4ec3648ffd804b6af05408fa06a5a14f105bc956c","observation_id":"c2f87e32-de1c-4df6-8d41-f21c45c57c44","resolution":{"observed_at":"2026-05-20T07:28:06.718341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"21a59597-7324-4228-a8c7-35ebb434b49b","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:1b011d1ac1fa1ea7d7e8d404f86f90651b05bf56281a98316dfd3d0530437e63","observation_id":"1b06546e-8fd5-4bf0-889e-d5238403854e","resolution":{"observed_at":"2026-05-20T07:28:07.795477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09459","last_updated":"2026-04-13T12:08:22Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":"2604.09459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09459","snapshot_observed_at":"2026-07-09T11:16:11.379473Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"b28c3265-685a-4be5-b6e3-cfcd46733d99","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2604.09459","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:77a536f27e080f4bfcc7fa8af102575bd0ab20edcfa5de9cd28876ecf283e895","observation_id":"cf422d56-d3d4-4fd6-814f-79948df646ba","resolution":{"observed_at":"2026-05-20T07:28:06.747246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":"33e9f949-ba43-45b2-9154-fde30b30e45b","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:a6c091359f1b31ba60734ec8525e19fcf8f93283ce4584cb4c57c98a8b9ed3f7","observation_id":"fb4dd984-5cab-4c60-b6d5-7b8ee616348b","resolution":{"observed_at":"2026-05-20T07:28:07.799533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:c2e1a7850183175387bc5d30f5b91c1250b2539960ee339bb0e77a590ccef8c4","observation_id":"19b192e4-371e-4a1b-ae75-3129d962a124","resolution":{"observed_at":"2026-05-20T07:28:06.706111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:d9706f8651398c0b96fb1523ec042c70b5fd92b83346214fec6a70298f9234e6","observation_id":"268fae63-85c0-4afc-8e47-1e13dcb335b2","resolution":{"observed_at":"2026-05-20T07:28:06.702664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EasyR1: An efficient, scalable, multi-modality RL training framework","venue":null,"work_id":"6b8ae63e-910a-4084-8f70-cf41d6ab417f","year":2025},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:e64c85be86ab59343cac0aec52cffbf9e651a4d2df28e50a4aa0eb86b9a415ef","observation_id":"8c601782-78d5-49c8-bcf3-7c09989aa339","resolution":{"observed_at":"2026-05-20T07:28:07.790952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":"2411.00836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-07-03T20:48:56.041994Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":"1b71954f-ae5f-4a76-9175-6e677f7b4c85","year":2024},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:1548679a8545c5dde3e1bd9f668969e88c3a04cfc3f4b7feb41dd98a907abee2","observation_id":"94f731f4-8d62-4817-aa77-2f3d071c6fc5","resolution":{"observed_at":"2026-05-20T07:28:06.725569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":18,"verified_fuzzy":10},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2605.19436."}