{"as_of":"2026-08-19T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:227b22dafc24fb18a683096178acc2f1b61c6ba1721c8413ddf78b6785de2465","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T20:06:18.832821Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28026/citation-record","integrity":"/paper/2607.28026/integrity","json":"/paper/2607.28026/citation-record.json","paper":"/paper/2607.28026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:09.660217Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:09.660217Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:2003958148671f83556196db232b41e34ff3fa8c291178d1ecc556da77867b2e","observation_id":"a57c262b-3c68-486a-9bde-0585c68292be","resolution":{"observed_at":"2026-07-31T20:06:09.660217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T20:06:09.797967Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:09.797967Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:dd385135077a18e9fd8804e58cefadae67938cb91c43f4fa2d667676a38b2040","observation_id":"52e5a969-9f83-4658-a4da-67d500890c02","resolution":{"observed_at":"2026-07-31T20:06:09.797967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:09.948016Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:09.948016Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:a426e1cfd0a23062ff9272afffbf7ad2c536f9789914615d7c3e64c57a0558e1","observation_id":"c1d53203-cac8-45b2-86a7-edbd7fbc4c42","resolution":{"observed_at":"2026-07-31T20:06:09.948016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:10.099044Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.099044Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:54534a459ffe3efee2d40fffee14f0d8cd8457699c14e8efda61ced19c7bd4c0","observation_id":"079aaf0e-e246-4db6-bf08-ea3eb1e5d7f2","resolution":{"observed_at":"2026-07-31T20:06:10.099044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-17T08:52:56.038060Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-07-31T20:06:10.315097Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.315097Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e794f95c1b8814aa07155d9f9861e8f1031440e1b579e6eef90cc0cf6a059a89","observation_id":"032d3af7-9043-4df6-94e3-156e805cafde","resolution":{"observed_at":"2026-07-31T20:06:10.315097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-07-31T20:06:10.418692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.418692Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:fcf9c5776f76471a44fcfd81c57393d8db0416a6458e0b1c71524055bdd8af98","observation_id":"cdaf69e1-27d4-406c-9c1e-d4b9f591388e","resolution":{"observed_at":"2026-07-31T20:06:10.418692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-08-17T02:32:12.643547Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-31T20:06:10.692173Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.692173Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:3b591d2ef3fa4736b8eb887354edb8391038f11070a3606322bfc511da297daf","observation_id":"e8f6096c-d3e5-408f-bc1e-5e230eb3c674","resolution":{"observed_at":"2026-07-31T20:06:10.692173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:10.812527Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.812527Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:58596435a4f2ccae2b04de32d2d5935773227b86d39027eb068cebfa37fa160a","observation_id":"401ce279-e4e8-4778-9d94-1d0ef45a49be","resolution":{"observed_at":"2026-07-31T20:06:10.812527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:10.902305Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.902305Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:cb252fd112af470533f653c082d09e753a91bceacf86224636b8341d56a8a84d","observation_id":"a2ab60e4-2204-4626-a93f-86058ab74c34","resolution":{"observed_at":"2026-07-31T20:06:10.902305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:11.010362Z","title":"D.; Sugawara, S.; and Aizawa, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.010362Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:a0b82894acada9e717ab5b612d5af7ddbab1be938b04befbd95b5731d038fb66","observation_id":"a2495cca-22a0-49d6-8930-800e7c4a11a7","resolution":{"observed_at":"2026-07-31T20:06:11.010362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-12T12:02:18.586804Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-07-31T20:06:11.131377Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.131377Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:acb836f169f9f506e698bf817569df337090fc163d5e2e9a4c617a61e205b7b7","observation_id":"8002fa03-45d5-4f2f-939f-4add6acc0de7","resolution":{"observed_at":"2026-07-31T20:06:11.131377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-31T20:06:11.255501Z","title":"K.; Guestrin, C.; and Krause, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.255501Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:60abf243f812de5d4f30153f5ad3c046ba6c944c3b830f9afe83cf49373e9c7d","observation_id":"62a27e60-91f8-4996-b4a6-8d16fdcd8b86","resolution":{"observed_at":"2026-07-31T20:06:11.255501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-31T20:06:11.327263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.327263Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:f64289ef53e3d24af5bf905fbeacb0dab69a89a94f1f69f85697795965c7913e","observation_id":"ae311834-9899-4aa2-a9bc-0655e4d0be03","resolution":{"observed_at":"2026-07-31T20:06:11.327263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-31T20:06:11.452137Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.452137Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:88fcd1ea8687568ca3a7c34fc80d92797c19a42d4fc84fc834b6b29a7b06384e","observation_id":"6cc5831b-2012-4f58-8e88-b6bfa626a414","resolution":{"observed_at":"2026-07-31T20:06:11.452137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09820","last_updated":"2025-06-12T12:50:37Z","snapshot_observed_at":"2026-08-17T14:20:11.142787Z","submitted_at":"2025-06-11T14:59:02Z","title":"CoRT: Code-integrated Reasoning within Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09820","snapshot_observed_at":"2026-07-31T20:06:11.549348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.549348Z"},"links":{"cited_paper":"/paper/2506.09820","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:2c0bd1ebb2d91829007d2ffc31b095c1a8bcb7af24d646718dfa97e514f9e655","observation_id":"d8e9cb95-6517-4128-a56a-3e4e6a7bb866","resolution":{"observed_at":"2026-07-31T20:06:11.549348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-07-31T20:06:11.655729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.655729Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:58fac6bef452c22f598dfa7ee69a6b58d4cf73340c746db02d642d2b449159c4","observation_id":"ed3bda88-b286-4d89-a83b-fb5cbb5a78a3","resolution":{"observed_at":"2026-07-31T20:06:11.655729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:11.775197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.775197Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:52fae84ec73d786ffcdb27446fecdf6a291a409b4a889378abca055cd59a0053","observation_id":"678c0b74-c1b6-41ef-88e5-a4d5f5c207a5","resolution":{"observed_at":"2026-07-31T20:06:11.775197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:11.846074Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.846074Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:849c4f7133d24fe9dcc6dbe0fe60e28d7bf4f928733bdbd1a0ab385c44d521ff","observation_id":"93e703b5-485e-4aea-812a-07769b483e2d","resolution":{"observed_at":"2026-07-31T20:06:11.846074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-31T20:06:11.916136Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.916136Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:dc59ffec4e1ef3c530ee556816d26397991b77f468376c22e3bf099b319f36c3","observation_id":"9eb363cf-e8b6-45dc-8dd4-30cba790929d","resolution":{"observed_at":"2026-07-31T20:06:11.916136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:11.982246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:11.982246Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:1c6852951985812e625ea6f336e6bc486a772fbe547d91a580c08021c7f3c806","observation_id":"ab20a02f-1cb9-419a-a9b7-c57271aa8c02","resolution":{"observed_at":"2026-07-31T20:06:11.982246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-16T20:35:48.643273Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-07-31T20:06:12.095360Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.095360Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:a1114b3fe7c2eb18852d7eddb358d9f4da7e23b668c5a59f86b9a5f185ebbdec","observation_id":"9e7f2b59-2a78-424b-be5d-41d9ff2012af","resolution":{"observed_at":"2026-07-31T20:06:12.095360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:12.224386Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.224386Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:13e8a386d460f5e31d7cc862dfffc2fcdeeab869cb31989d3aaee22b3d0ec536","observation_id":"e82e2748-b1b2-4c7d-8af1-c7965ec7ffd1","resolution":{"observed_at":"2026-07-31T20:06:12.224386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:12.347223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.347223Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:be7d99de9d1f9b483fe4e5456b2992f9b8a9311beab23da7a7c304f9d1d464f1","observation_id":"cb1f136a-c96c-44d0-988e-ba3c11983bbc","resolution":{"observed_at":"2026-07-31T20:06:12.347223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-08-16T02:55:53.932381Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-07-31T20:06:12.421263Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.421263Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:538f3239212e9ef086a42d6d50ae4c5322475f31dadf7f4d4e57e642a0ffd567","observation_id":"9de57c66-ddfb-431a-a362-d76b9ef0e045","resolution":{"observed_at":"2026-07-31T20:06:12.421263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-31T20:06:12.487930Z","title":"B.; Kumar, A.; Zhang, G.; and Levine, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.487930Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:ce2b5c8b9d86acf8f54f1c5a24f4c2e9caa48104811b3d8babe2a2b33302e105","observation_id":"ada30bc4-d367-4783-84d5-4505a4ff3a49","resolution":{"observed_at":"2026-07-31T20:06:12.487930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-31T20:06:12.558874Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.558874Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:5ee7adfb9091b643d4c6e53e1cba97807b0acc1321f8ae4910369ffb677ab8a1","observation_id":"0963b69d-513b-4722-9f53-b6e98d6d77b2","resolution":{"observed_at":"2026-07-31T20:06:12.558874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:12.679843Z","title":"A.; and Lewis, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.679843Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:8a57c47c42195df7b8bfe89984f9fd0b4932b398e69448ee5aa4c0a9bfd82650","observation_id":"c9fa9b8f-0a71-4404-bfa8-50257e2d7f2b","resolution":{"observed_at":"2026-07-31T20:06:12.679843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-07-31T20:06:12.771078Z","title":"C.; He, Q.; Wang, H.; Chen, X.; Hakkani-Tür, D.; Tur, G.; and Ji, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.771078Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:f9a26b93b391d6f14d37aa9e53c89b429740abb80b64068f159e654678f272fb","observation_id":"4092235b-ccae-4176-85bf-b185cc3f057f","resolution":{"observed_at":"2026-07-31T20:06:12.771078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-07-31T20:06:12.826891Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.826891Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:411d0dcd799f821d73b906ce4774104520d9eca8053317517a35cdcb0388ece9","observation_id":"34a1e834-d20b-47b2-8a3c-e1d6e14a4129","resolution":{"observed_at":"2026-07-31T20:06:12.826891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-31T20:06:12.878590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.878590Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:70f173aa0b14a5718a1f0725e3b04403bd26596452f3fcbdd3e6cb25065093b5","observation_id":"9a661eac-8563-4f2a-a7ef-5e93bd6d0096","resolution":{"observed_at":"2026-07-31T20:06:12.878590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-07-31T20:06:12.984770Z","title":"I.; and Abbeel, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:12.984770Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:1e97b939637fb60942dfe96b3db2fc9cfbfa2a3dd3bd77da3dcea530a006514a","observation_id":"91871e85-3f73-4f91-a227-2b77ec7785f3","resolution":{"observed_at":"2026-07-31T20:06:12.984770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T20:06:13.171364Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.171364Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:48640a156e47bc3d1edd2480fbbb2b5fb763ca8012684b9fc5d28315ad5c674a","observation_id":"62bbf2f3-e045-4d4e-8366-0fc3a5a9b147","resolution":{"observed_at":"2026-07-31T20:06:13.171364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-07-31T20:06:13.270674Z","title":"X.; Fang, L.; and Wen, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.270674Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:047339b3660449a471e9bf905bfc15ac1f73b48f7c8391d3cef7e47be7cf36e2","observation_id":"72b3b020-c5c2-47dd-a3f4-1e6b8b5d2a7e","resolution":{"observed_at":"2026-07-31T20:06:13.270674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-31T20:06:13.333132Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.333132Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:fd111748bf3e3c89634706eaf5c0dc30e0f8c540cfd8df92488ff3f6c2974dd1","observation_id":"dab872a8-80f4-47d3-bcc0-6e660dfdf5c8","resolution":{"observed_at":"2026-07-31T20:06:13.333132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:13.436571Z","title":"X.; Liu, Z.; Fang, L.; Wang, Z.; and Wen, J.-R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.436571Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:30d564d938b91e8d4fdea3c329519f883dcd9b3faa73de3853ee90360e3fc298","observation_id":"811a75d3-c651-446d-a832-ee15c4909a8d","resolution":{"observed_at":"2026-07-31T20:06:13.436571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-31T20:06:13.484761Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.484761Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:cd53bf3c2314070bfb2fe9f2c071b9b09f052b6deeb354250a27f0b87785beaa","observation_id":"018541f5-f4e5-452d-952a-a769dc764789","resolution":{"observed_at":"2026-07-31T20:06:13.484761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T20:06:13.667751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.667751Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:ddf4075ebe3fa8db1c6c0646bca48863c6244a3bb5cbcb38dab12e2da70bc755","observation_id":"e131f767-25f6-42a7-932d-9ec8ed7670e5","resolution":{"observed_at":"2026-07-31T20:06:13.667751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:13.724129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.724129Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:df8fdd4b499952ac62c7ce10a11a0d4eee6d9a3960cbe0f9f2c8441296e4bbac","observation_id":"8624e6d0-bb2b-480e-895f-50db18ebc1c5","resolution":{"observed_at":"2026-07-31T20:06:13.724129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:13.786194Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.786194Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:0664ebdf25330a16d2d16b0b3e1112bec4b522e6c2e6beeb1e7c5a81c483097f","observation_id":"b5e99fc8-d4e3-458f-8d85-93fc80964da7","resolution":{"observed_at":"2026-07-31T20:06:13.786194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14870","last_updated":"2025-05-31T20:08:42Z","snapshot_observed_at":"2026-08-17T10:37:01.064934Z","submitted_at":"2025-04-21T05:40:05Z","title":"Acting Less is Reasoning More! Teaching Model to Act Efficiently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14870","snapshot_observed_at":"2026-07-31T20:06:13.834925Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.834925Z"},"links":{"cited_paper":"/paper/2504.14870","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:7c902df1cbb7339464c4f7e94c345461c97bd65542c918d31eceabb7a573ad88","observation_id":"9b21d4aa-800b-41f8-9efe-4f2e9bf4e5a6","resolution":{"observed_at":"2026-07-31T20:06:13.834925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-07-31T20:06:13.895257Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.895257Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:9e455d0e69ce4e83959ede0d425682b0cf4c9568cdaadc121e5aef0cf225113e","observation_id":"8602b83e-74a1-4df6-adf4-69a7ced1361d","resolution":{"observed_at":"2026-07-31T20:06:13.895257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-07-31T20:06:13.989520Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:13.989520Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e6b9179bb3b395f508936a8c46f72d506d9d1dd9ca620ed23a9e6194f553f909","observation_id":"b3e667ac-d082-4c4b-b015-1688e38ef6e1","resolution":{"observed_at":"2026-07-31T20:06:13.989520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-14T06:23:46.085198Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-07-31T20:06:14.128623Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.128623Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:3b0754f4f1abc114143e9ffb0dab9f9d5885ececf9876a07acf34c80bc3b3a3b","observation_id":"5c68a7ed-1f71-49fa-b8e9-d74a21fbd5aa","resolution":{"observed_at":"2026-07-31T20:06:14.128623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-31T20:06:14.199650Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.199650Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:7b1a3f98aac757a200f3d28777f8ec366bcff042d3fe47a146e72e10d0479ff1","observation_id":"846cd24f-ac38-48f1-8360-f23f935f241b","resolution":{"observed_at":"2026-07-31T20:06:14.199650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.300743Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.300743Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:02f562b0eee9d7c3a884ee561e6bed65efb335faffa7fd5b89e360155f46d263","observation_id":"550d5251-4169-4b22-9ba6-d06c224b8420","resolution":{"observed_at":"2026-07-31T20:06:14.300743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T20:06:14.419599Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.419599Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:ffe0ac0e62ef1bccbcddd1c9212bc318afd8260875f40fc2adf4f83f5da6b961","observation_id":"25ca512c-9c07-46af-ba54-6d7c2d508b3b","resolution":{"observed_at":"2026-07-31T20:06:14.419599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.537242Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.537242Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:405c604e83125a612162bdb837d2b656c60d47efdd1fc44c6f5bbe4a667d98df","observation_id":"88a9b1c6-d37d-4c86-8a4f-7534b224ec5a","resolution":{"observed_at":"2026-07-31T20:06:14.537242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.625513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.625513Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:af5dfb5f4893d8b474d099d1e08618b1b219c1d870a9d7ac99d3fefc0433d1ff","observation_id":"44cd3696-1fcd-4a30-86eb-60f4ca868a4a","resolution":{"observed_at":"2026-07-31T20:06:14.625513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.711800Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.711800Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:f68ee8e6f3e830f1ebafa987e50c65db0b62b81622689464a07e1aefbcd27bb7","observation_id":"59d94601-e7fe-4ece-8812-da39d05c3d6a","resolution":{"observed_at":"2026-07-31T20:06:14.711800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.766543Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.766543Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:60030fc7eb71cf1bff4e91f9e557623eb8c822eaf41c0ac0dca032d7f50d56c4","observation_id":"d86c6bd7-1c4e-4495-bdfa-6b80e3d6fe9b","resolution":{"observed_at":"2026-07-31T20:06:14.766543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.839334Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.839334Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:a16a6696cda6c2ed4653808b0676e8973218febb2fbc9110497c7ac8a7e34924","observation_id":"8608f900-1a77-4b0d-b0db-4c1925a5e8e6","resolution":{"observed_at":"2026-07-31T20:06:14.839334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:14.952774Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:14.952774Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:79a344a5a65f98f92424d17e41b88e81bda6dc6c98925577c4d8aa64325ee6d1","observation_id":"9d395184-cc6c-49d2-9bd7-04652f2b188c","resolution":{"observed_at":"2026-07-31T20:06:14.952774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.046759Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.046759Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:71af6ecee59fa0f33eed59511835dafddfa4cb236c226156092ed876c026a90a","observation_id":"44a8c549-a6a1-499d-a19f-0e7be510b8ba","resolution":{"observed_at":"2026-07-31T20:06:15.046759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.104480Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.104480Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:fb2db99715daea965784c2ec036b60c84c4538239d12889471e616b24cb82ab4","observation_id":"3332816d-4ffc-4dfd-b74a-ee3d6859d39f","resolution":{"observed_at":"2026-07-31T20:06:15.104480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.192925Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.192925Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:7fea4273274515754960bd0325b608edab70e69fcf300eb18ccf7dc364f5e333","observation_id":"6fe8b07f-b698-4f43-b9be-3220b8175815","resolution":{"observed_at":"2026-07-31T20:06:15.192925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.298526Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.298526Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:c4890d4b56c0bc0a107b64651e2eba16babcc96cb47ff1da2d2de8f3ace8f3d2","observation_id":"ac0b075e-f6f5-4a60-98ee-80c00cfee5d2","resolution":{"observed_at":"2026-07-31T20:06:15.298526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.424298Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.424298Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:65299f4850c560170c45cf9e029dca241046ebb3912b4cc7ff4723e89095e090","observation_id":"9e09070b-5bb1-44e6-ac6e-36e3ff0e8031","resolution":{"observed_at":"2026-07-31T20:06:15.424298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.516068Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.516068Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e7621ade9357d843dd1c5770d66cd3a90a21d5241bda596199318fbe6a50c02b","observation_id":"b371e495-e319-4735-bc9a-64b54857c711","resolution":{"observed_at":"2026-07-31T20:06:15.516068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.562071Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.562071Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e327b1761caacfe651568da6a1836938ecad6d5f1664f9c2920fb735a3ed089c","observation_id":"543e41ae-722a-4286-bf4f-673b48dd2459","resolution":{"observed_at":"2026-07-31T20:06:15.562071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.623282Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.623282Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:da5cc820b0fd16a070c1a0651967a8c738ebbf70455b7c27fcf5bd20930eb849","observation_id":"12c26a91-dfee-44a8-8300-8892d7bd539b","resolution":{"observed_at":"2026-07-31T20:06:15.623282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.683841Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.683841Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:b4eb0d400319877fdefca321cf0032475ab4816d4e6b3a2adda3006077efb1f6","observation_id":"1743c439-9a8d-4aa0-a6b2-86ae8b402a13","resolution":{"observed_at":"2026-07-31T20:06:15.683841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.749648Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.749648Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:ba95c1173dead9fd85b74455411dc9b722d8c4c956ef0ff85561dc22f89c3035","observation_id":"e0f59ccf-2626-4a01-b237-66fb8e5e2152","resolution":{"observed_at":"2026-07-31T20:06:15.749648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.862134Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.862134Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:18b1ec9e976a6a1425853e6e76defc9b5a72550cfbace1fbe04fa10bf5aa40ee","observation_id":"6cb86448-61a3-4dab-9654-2f6fa6622c70","resolution":{"observed_at":"2026-07-31T20:06:15.862134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.924752Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.924752Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:4d1ddf289b6306974f4c95c4a444c332444531ef5fd518fcf219d92cfe2644af","observation_id":"1e6b0060-32ca-450a-ad26-ed13e820aa18","resolution":{"observed_at":"2026-07-31T20:06:15.924752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:15.975629Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:15.975629Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:be747e5f680d4ba208b63a0e8f77a4daa15c2a787f883c57d0748cf4c97b46a2","observation_id":"4e012e7c-5b89-4f09-8281-fcd6c9086c2d","resolution":{"observed_at":"2026-07-31T20:06:15.975629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.060463Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.060463Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:d7d1a7b6e46b290a72de479a4629fdfd05c71c7bd321d5d26dc3e278c5b4ab41","observation_id":"16202c2f-256f-4467-af26-5fe53b79dd4d","resolution":{"observed_at":"2026-07-31T20:06:16.060463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.128351Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.128351Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:b1e4e6867d1fe9956ba9112a5e8c11eff4a9e5c52efe17d27619472d05c84fa6","observation_id":"0a41fa58-5dbc-451f-944c-d9fd867cd7e4","resolution":{"observed_at":"2026-07-31T20:06:16.128351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.194956Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.194956Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:52c8398874636109b049b26341257a45a54fc888204f5bae96e30440a60dc260","observation_id":"3bd9eeee-7a96-43ad-b2b9-ea856e3848a8","resolution":{"observed_at":"2026-07-31T20:06:16.194956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.276264Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.276264Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:529b40c8d346b2feaa67af5190dacd89ab14d43cda4810c288d02404f815305f","observation_id":"054422f6-b294-4362-91c1-c4782176615d","resolution":{"observed_at":"2026-07-31T20:06:16.276264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.314303Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.314303Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:0d3f504ad81644ef6207eaf8499c96b0cbbc642fe06e50821e1f1d9b28af2344","observation_id":"ce9cee68-264c-40f9-956e-2a305d5ed643","resolution":{"observed_at":"2026-07-31T20:06:16.314303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.383494Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.383494Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e532646e9aca5d7e1a87acf89a90873cbb0ff8cee806ed2b99e19f7af5b6599e","observation_id":"f5d52a3a-126f-4b35-89aa-50842525c4a2","resolution":{"observed_at":"2026-07-31T20:06:16.383494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.433285Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.433285Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:1654e554868e0514c9d35530bebf6123bb10384fef1bd1a4fcb2b1834ab555fe","observation_id":"5061c51f-b42d-4e67-a605-111aef5eb10d","resolution":{"observed_at":"2026-07-31T20:06:16.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.493620Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.493620Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:0dbcf345886e2d69597aeabc31a2ac0fea56d54d5c8fd79107be67fb0018a6fd","observation_id":"5d18457c-9127-4333-9e0b-d59a3fcef5b3","resolution":{"observed_at":"2026-07-31T20:06:16.493620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.544150Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.544150Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:f643937bf4181ea1a4a646cd992f4e972772bd39785668322475d95070e0d2cb","observation_id":"849d2471-d40d-4995-a925-01da668dae6c","resolution":{"observed_at":"2026-07-31T20:06:16.544150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.612575Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.612575Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:83a76c48dc57dca5945c9c837ee67581fe1c016692d05a5d1983692d9ad793ae","observation_id":"8b890c80-d7df-4a71-a5e3-2eb1bbbda0eb","resolution":{"observed_at":"2026-07-31T20:06:16.612575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.664956Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.664956Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:43457ac6d92e0cb8be62fa44b76cc65db7d61e1a6f0d1686775a1c627ae15e8e","observation_id":"5ebbab12-40db-4e2d-9e42-fbcbbfaf0d50","resolution":{"observed_at":"2026-07-31T20:06:16.664956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.733403Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.733403Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:8a956ca1ae0211d439657578db115784c2087adcfbbfb0596be546b9094d2c1f","observation_id":"d3f64341-ca73-4245-ab5d-8bf92be0bd53","resolution":{"observed_at":"2026-07-31T20:06:16.733403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.811324Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.811324Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:80185305fc070279a8cbf02112e408dba6eb54f24d896f9d9c6c497f696847e7","observation_id":"131a81a1-2ec6-4d91-9692-897bedef8767","resolution":{"observed_at":"2026-07-31T20:06:16.811324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.922134Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.922134Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:f4a2b5963a9172af6991a8347ab778c7ea1534574edbc7fa0d7017ddf95cffc8","observation_id":"97aa4d34-18bf-484b-96ae-cd0a026c30df","resolution":{"observed_at":"2026-07-31T20:06:16.922134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:16.999661Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:16.999661Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:83f731b34c50bdc79b2aa0eff058d2a1b0d2a7888bc258172af396ef7ad5b2da","observation_id":"28dd0634-a439-4a5b-ad1e-3d9850fe217e","resolution":{"observed_at":"2026-07-31T20:06:16.999661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.113456Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.113456Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:125dc4ab2b55495895fb7a63424f9d0c9aa381a8a65f193193ad110014bc139d","observation_id":"eeb9cd58-0ba9-44e5-97a3-6401d897ea80","resolution":{"observed_at":"2026-07-31T20:06:17.113456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.186190Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.186190Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:8f7ca4b581dfa9ec3aaad867b42a83b7c290ea4685305d0d3cafa693c412cc90","observation_id":"8ee5a9a5-131e-4bba-93ad-230fc8fb2c91","resolution":{"observed_at":"2026-07-31T20:06:17.186190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-14T06:23:46.085198Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-07-31T20:06:17.267411Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.267411Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:06de5a5091d4d9f3349e8c2af14f0054312ddc5bb8e9b4325a81836aa2d5768e","observation_id":"263eb880-823c-416d-8b72-850373b39ef7","resolution":{"observed_at":"2026-07-31T20:06:17.267411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.361743Z","title":"H otpot QA : A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.361743Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:8d091096375b6f5e11297b3810dfea731864e9907d5fc8fa3d8eafb6da5a20cd","observation_id":"4807d86d-2c0d-42c5-babe-8f7a14350a00","resolution":{"observed_at":"2026-07-31T20:06:17.361743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.415396Z","title":"Constructing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.415396Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:7f9b1958b8d727504ff936c7c7e39b70ec7dd5275ef702bfb4d5960966a5fbe3","observation_id":"2b670483-abdb-4cea-939a-bb0cf1118122","resolution":{"observed_at":"2026-07-31T20:06:17.415396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.514321Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.514321Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:914245587f15ad350cad38edccf6e8bea02da89e28570495e8d3b66832002d1d","observation_id":"8b17e206-de3f-45bd-a77a-f48fb3f1a918","resolution":{"observed_at":"2026-07-31T20:06:17.514321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.617436Z","title":"Smith and Mike Lewis , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.617436Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:748be2bae52464420aa6c400464452a5531c8a0306dc8433d6fbc9b919778b21","observation_id":"9293f171-e8e9-4a4b-ba3f-b906d1218c37","resolution":{"observed_at":"2026-07-31T20:06:17.617436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:17.721536Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.721536Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:b53060239cfe42feb80cb7eac0ff610021dbe8b2d59d29f57400580b028fec9c","observation_id":"890ed648-0450-47f9-8569-e41e3502dfbe","resolution":{"observed_at":"2026-07-31T20:06:17.721536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-31T20:06:17.833208Z","title":", title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.833208Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:36cfd3ed1e6410753ad0f317ca1da1da52fe26f5c7902ced8c640a405b74cc70","observation_id":"b9ad37d2-76ef-456d-b4bb-305020f4f8d5","resolution":{"observed_at":"2026-07-31T20:06:17.833208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13651","last_updated":"2025-06-16T16:16:14Z","snapshot_observed_at":"2026-08-13T10:30:44.297570Z","submitted_at":"2025-06-16T16:16:14Z","title":"xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13651","snapshot_observed_at":"2026-07-31T20:06:17.957159Z","title":"arXiv preprint arXiv:2506.13651 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:17.957159Z"},"links":{"cited_paper":"/paper/2506.13651","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:9ee0080d18d831739f30588b56c5bfef85fed876f3735805de2d9c656523f049","observation_id":"f9dd0a5b-95db-457e-a828-5b1ddcc9d7e0","resolution":{"observed_at":"2026-07-31T20:06:17.957159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:18.039899Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.039899Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:46e5a6fb6680a71088fb6944fe1514d158f080bc72b7dcc12d7d8bb17676d89d","observation_id":"fa5ab322-c608-4204-a62f-46fe6816f7df","resolution":{"observed_at":"2026-07-31T20:06:18.039899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-17T08:52:56.038060Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-07-31T20:06:18.144305Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.144305Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:a02bb7118ad0507f71e47787126c7949d4bf67a4b3ce4b7da1c0ed49083ea92d","observation_id":"b6ccbbc4-bf13-4618-b828-bd37700535d2","resolution":{"observed_at":"2026-07-31T20:06:18.144305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:18.249687Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.249687Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:e5740d326e74f8faf06a0b11f75d8b4b0c2551192f3b7de3b3ceeb7b74e22e2e","observation_id":"9ada9f8a-0811-4840-b194-490a576432e4","resolution":{"observed_at":"2026-07-31T20:06:18.249687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-31T20:06:18.352604Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.352604Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:dc07b478d2a9245fb27f84fa44aa12b3d5aa97ed1143a5d86b189d8d515bcfe1","observation_id":"0641966a-50f4-4f8c-af2d-8acff291ea1f","resolution":{"observed_at":"2026-07-31T20:06:18.352604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T20:06:18.447646Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.447646Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:1584d5d6ecca050a36f8948334b05d104ad3a58ea99d0765aa59d74e1ee40dd9","observation_id":"87f63080-8ba1-4606-bc5d-7bcb9447781c","resolution":{"observed_at":"2026-07-31T20:06:18.447646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-07-31T20:06:18.552844Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.552844Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:b947fd0fbdace12a39f5b447e2c71de63d3a493a6d0d60c035ab1c199108ddd1","observation_id":"3ddbcd7c-9a1b-45ab-b37f-798aa9b91dc1","resolution":{"observed_at":"2026-07-31T20:06:18.552844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09820","last_updated":"2025-06-12T12:50:37Z","snapshot_observed_at":"2026-08-17T14:20:11.142787Z","submitted_at":"2025-06-11T14:59:02Z","title":"CoRT: Code-integrated Reasoning within Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09820","snapshot_observed_at":"2026-07-31T20:06:18.658766Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.658766Z"},"links":{"cited_paper":"/paper/2506.09820","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:d5446042e6781355345e3f41e2d1a3231d308ac26d302786a7bbe2c3b317f32a","observation_id":"a017e6ba-202c-4485-93bb-6e5508be01ba","resolution":{"observed_at":"2026-07-31T20:06:18.658766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:18.759274Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations) , address=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.759274Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:2cab18c1ac3e4e591f623b40ba4c68d38b9102650ebbd2ca4e51672061be7c5c","observation_id":"3517e788-ab76-46b9-9ce7-f6e87a9da2d9","resolution":{"observed_at":"2026-07-31T20:06:18.759274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:06:18.832821Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.832821Z"},"links":{"citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:9e5d1e42f9f8bc9e7e5dd7e56083f07b0b17da7e4bd72b6d05318590dee396ea","observation_id":"9a783ed2-84d5-4b31-9c67-0cbccbdaa270","resolution":{"observed_at":"2026-07-31T20:06:18.832821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T09:07:59.490818Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2607.28026."}