{"as_of":"2026-08-01T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bde3943f5b997c4e65d4d072162ca1ac02b3a8f8928ca65ec2399c17411ff070","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:11:48.615352Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T20:06:10.692173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T13:49:51.404418Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:06:28.465349Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2605.12483"},"observation_digest":"sha256:593a6b45217f76f184a04cfb3de1fa1ae8767087092491e8deef2eb2cc782c93","observation_id":"8ed2062a-66bc-4dc7-ba10-761a38675c7f","resolution":{"observed_at":"2026-05-13T05:07:17.328536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T05:24:11.988955Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2605.12483"},"observation_digest":"sha256:d3797b8b1effe25589c8aca912fa675215f73ab2c7eb6a3c0ed6a9d69237de2e","observation_id":"55d2e9ee-45dd-4a31-b50e-46df0aa518fe","resolution":{"observed_at":"2026-05-15T05:25:04.064933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T16:42:12.419460Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2605.12483"},"observation_digest":"sha256:12a1e0f019136b4ffc1a29bd4e77cda66bd10d601c2c3a4fb9d474ed51cc0064","observation_id":"4a729238-cd58-4609-8297-be17f3b61c7f","resolution":{"observed_at":"2026-05-19T16:42:39.627180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:57:16.107445Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2605.12483"},"observation_digest":"sha256:1da7aec700d44e6df5d55bebb0fa6dbc12bbdc2dfeed0c7b5c7bd32490984240","observation_id":"ed8a92d8-eaea-490a-bd42-e97fc6caf24c","resolution":{"observed_at":"2026-05-21T07:59:50.390088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2606.22793","last_updated":"2026-06-22T03:09:21Z","snapshot_observed_at":"2026-07-06T23:57:38.036151Z","submitted_at":"2026-06-22T03:09:21Z","title":"A Formula-Driven Survey and Research Agenda for On-Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-26T09:02:13.340365Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2606.22793"},"observation_digest":"sha256:da272723bae1954fea1271383f8cb7f71f7329383792fa7093cc69912136408a","observation_id":"ded4138f-fdb2-4d05-8670-32c6e99d2402","resolution":{"observed_at":"2026-07-04T10:19:47.122737Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-07-12T11:44:53.084477Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T04:55:42.018348Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:e4092c6d494a031165d6915f8d61cf1bc182616171f86b1aaaef2e69ffbdb912","observation_id":"0fec8392-90dd-4ccb-83c9-d201d8fc813a","resolution":{"observed_at":"2026-07-04T13:49:51.405652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-12T11:44:54.717393Z","title":"Rubric-based on-policy distillation.arXiv preprint arXiv:2605.07396, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-07-12T11:44:53.084477Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T11:44:54.717393Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:2f0200a761883ae80205de64dc1b611e1a7a14e248a659069e8bf21aa6bbbcb1","observation_id":"8e0da16f-9ae3-4162-b365-4ec58e0a841e","resolution":{"observed_at":"2026-07-12T11:44:54.717393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-04T13:49:51.404418Z","title":"Rubric-based On-policy Distillation","venue":"cs.LG","work_id":"c10aafd2-e520-4829-b1a8-b460c24ea267","year":2026},"citing_paper":{"arxiv_id":"2606.32017","last_updated":"2026-07-17T21:52:23Z","snapshot_observed_at":"2026-07-23T23:19:22.568219Z","submitted_at":"2026-06-30T17:48:07Z","title":"TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T06:07:43.151474Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2606.32017"},"observation_digest":"sha256:f5e49dbcce3c1adbc331cdd919889e7bf691557634fca265ab573be07be3b7a4","observation_id":"ec1741eb-a520-4e04-9e2b-59df07cc9c8e","resolution":{"observed_at":"2026-07-01T09:55:40.388513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-12T10:00:13.340163Z","title":"Rubric-based on-policy distillation.arXiv preprint arXiv:2605.07396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.32017","last_updated":"2026-07-17T21:52:23Z","snapshot_observed_at":"2026-07-23T23:19:22.568219Z","submitted_at":"2026-06-30T17:48:07Z","title":"TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T10:00:13.340163Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2606.32017"},"observation_digest":"sha256:2058295cf86caa7d2d48cd9f5169a590afb3455e99978bddcd06b76b5a0ae893","observation_id":"f753e198-44f7-4837-9abe-bedc5902ee1a","resolution":{"observed_at":"2026-07-12T10:00:13.340163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-30T18:33:28.472370Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-29T13:03:07Z","snapshot_observed_at":"2026-08-01T18:50:16.305708Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.472370Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:d6bdc1949344be3a3834d714ada86083043290a344ec49c6cff81d9cddc84e11","observation_id":"27a9dca5-5171-48ed-a4cc-d2648d634b16","resolution":{"observed_at":"2026-07-30T18:33:28.472370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07396","snapshot_observed_at":"2026-07-31T20:06:10.692173Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-01T18:26:50.306822Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.692173Z"},"links":{"cited_paper":"/paper/2605.07396","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:be8e1dee946ddee870d220e4ae4fd3804c4ee09c13f6ff46934d7f9fccea05e9","observation_id":"e8f6096c-d3e5-408f-bc1e-5e230eb3c674","resolution":{"observed_at":"2026-07-31T20:06:10.692173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07396/citation-record","integrity":"/paper/2605.07396/integrity","json":"/paper/2605.07396/citation-record.json","paper":"/paper/2605.07396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2024: American invitational mathematics examination","venue":null,"work_id":"80de3ad8-8675-43fb-875b-a9a103ae37b8","year":2024},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:e9a3e713ebb3190f104834b82a8ded40878452b5c9848912898403213e938580","observation_id":"6c5fd82d-1245-47ee-8eb3-250eac7a674d","resolution":{"observed_at":"2026-05-14T13:50:58.900050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2025: American invitational mathematics examination","venue":null,"work_id":"97017234-880e-4b5b-b0f0-8eb2b6560aaf","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:67c483d99783585ab117cd340c84894d51347f603c4fd9a14536bcb8cbd01b35","observation_id":"909b52a6-6ac5-4cd8-ad13-0d655e524d77","resolution":{"observed_at":"2026-05-14T13:50:58.905840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hmmt 2025: Harvard-mit mathematics tournament","venue":null,"work_id":"79e89c40-8824-48bf-aa62-f791d8ebe9c2","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:d49413fc6ae9a17f4f28fdb32daa30390dfe45e0191a177274b0c6f5886d196f","observation_id":"9c829ee6-41d2-4722-b442-2372563348f0","resolution":{"observed_at":"2026-05-14T13:50:58.912294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:fc0fe8315496fa74f19908ae3a2d3201bd533c319ede90eb733107d7aee83a91","observation_id":"77c15710-70d7-4081-b2f2-eb3e7d1cda30","resolution":{"observed_at":"2026-05-11T03:50:57.134686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:e79b7cb86aefb91acade557b5ba87045273676c0413c10c9c35f183fc9bb4362","observation_id":"74e68ed5-5aa7-4af2-98d1-b7a74ade6677","resolution":{"observed_at":"2026-05-11T03:50:57.141303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"a04fb9b7-95c6-4d9c-b4c5-d321dc763095","year":2024},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:1bec83579703fea48d3de6946995264006c9928c289006175fc17c39b03f1572","observation_id":"3ee7d872-b244-411d-a97f-cba68c5d2e54","resolution":{"observed_at":"2026-05-14T13:50:58.903186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-policy distillation.Thinking Machines Lab: Connec- tionism","venue":null,"work_id":"0de7c21c-9014-4146-818e-da26e8f4563f","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:8d1db55a942bcfa6ba676d166059efa1a73559764cd6afed4197734232aea1ac","observation_id":"a1d71531-00ed-4506-9bab-9b232a4a0064","resolution":{"observed_at":"2026-05-14T13:50:58.908691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"590fa84a-a439-4c3e-bde6-0eea001dc43f","year":2024},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:47ab3294e9a75056f677fb05e5fc8b664067b7b2211eb36c2fd5a541925794b5","observation_id":"edfe6e59-24f6-417d-864c-a71a03ba0edc","resolution":{"observed_at":"2026-05-14T13:50:58.867032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:eb854c0128f432405324aec7526ea83f83c49f79c1d3bc0963706139e27e527d","observation_id":"b2fcff5e-cd76-476a-a287-c3967352edb3","resolution":{"observed_at":"2026-05-12T11:33:32.947936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:26.457128Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":"b5a5843d-47c0-432e-88d5-c9eaac555a7f","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:3bc0e2b3f9484c75d80e77f0bc0987e9287223b41ba0244670f0c571e92444ea","observation_id":"f78ed212-9337-410a-9b5b-b6d957c917b4","resolution":{"observed_at":"2026-05-14T13:50:58.892826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-10T14:47:14.590391Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:d0c25e1fcd9a152b460219e51be9f8c72b90ef34bd5c8fb2567d34a3aa45a9ee","observation_id":"5a52485b-aa4f-43c7-8a1c-816801a8679d","resolution":{"observed_at":"2026-05-11T04:00:34.729655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-07-10T18:57:31.585722Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:fd3c48ca5939780c9571658d25e4092246d9006244b75234b5e1156259a05f37","observation_id":"535378bd-d426-4159-9a0d-0812dda82368","resolution":{"observed_at":"2026-05-13T05:18:21.444858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:d6c95c83eb856990ce4ceabf91659ce8643e8c5ca1fa9cc47123f1807a2c7bf2","observation_id":"9b7ac68b-3f3b-45b6-bbcc-8724a2a20f85","resolution":{"observed_at":"2026-05-11T03:50:57.108898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:5c116d9b40e10197e0575b00e5f841babd84d64f0257fd3068673aa95f7f83b2","observation_id":"0a2f4fce-77c7-406e-8a5d-fef850456165","resolution":{"observed_at":"2026-05-11T03:50:57.101768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-5.2","venue":null,"work_id":"e286445f-1dbc-4a42-b5e7-20e61e37dff2","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0b4177dd6e57dd261e4a6038d3aa9fa8779ff2d8cb0673c2a714bc0b73b208db","observation_id":"fc74801f-a17d-494c-b0d9-27cf36f9c458","resolution":{"observed_at":"2026-05-14T13:50:58.869201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T05:23:21.528605Z","title":null,"venue":null,"work_id":"d6cd0d9d-111e-4d8e-a74f-f09c1d1b128a","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:364f37256fe959dd0e8365ecc50b9a4766ee0e6ad037a902df06cabde33a5649","observation_id":"33401334-b012-4451-b826-d68f0aedf8eb","resolution":{"observed_at":"2026-05-14T13:50:58.865067Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":"2604.14084","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-07-09T21:06:34.840057Z","title":"TIP: Token Importance in On-Policy Distillation","venue":"cs.LG","work_id":"6509a633-b810-4a8d-9de9-8a9b59a768d0","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:c02438923abdcf69771928829a9b24540b0035af832e838e4bb0ee32390726a5","observation_id":"ba62b43c-0f08-4634-9152-049db05ca05e","resolution":{"observed_at":"2026-05-11T03:50:57.105335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":"2604.13016","doi":"10.48550/arxiv.2604.13016","metadata_source":"pith","pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","venue":"cs.LG","work_id":"42b43df0-4c82-493f-9d9b-1be8c116d9af","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:db5d1275913a2b6d0ff20690ecbc88448a261ca7b21f5db204efce00f0d27832","observation_id":"a22ab1d1-daa9-4b56-ac0c-f017bbedb69c","resolution":{"observed_at":"2026-05-11T03:50:56.992896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:ffc49828aa8a801694b4bf1c93907fd9258754b792ea7be210fe767d840f75a6","observation_id":"2c1a88c1-b4ea-4a1c-8dfe-0589eb6f0b4e","resolution":{"observed_at":"2026-05-13T02:47:19.238105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:b367bad5d52cd5aaa8d8ab4788ed1d21aed1599bae48211d9c619a7a5594105b","observation_id":"719ad1a4-3505-4107-9790-88cd3745740e","resolution":{"observed_at":"2026-05-11T03:50:57.088106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21968","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ovd: On-policy verbal distillation","venue":null,"work_id":"1dd036d8-9bc8-4058-b22c-74f4500f0e68","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:4eed321533d5c25cd7fd5837561f1455c542e86d1f24c462d35994643f8ccee9","observation_id":"7038d868-74a7-47d5-9a51-81b3da79b071","resolution":{"observed_at":"2026-05-11T03:50:57.074140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10643","doi":"10.48550/arxiv.2511.10643","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Black-box on-policy distillation of large language models.arXiv preprint","venue":null,"work_id":"1e58a1be-9294-4bd3-8040-3516dcebcd4a","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:3bf3bc91b6d0e390f266dab8990ec2f950e3665a5771205738056363fef1211f","observation_id":"1a384439-735f-48d5-bf3d-1085da2a354e","resolution":{"observed_at":"2026-05-11T03:50:57.113120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":"2602.12125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-09T00:35:48.740330Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","venue":"cs.LG","work_id":"bb968107-1f43-4bf4-aa52-cc58000a6e89","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:b595c49c79942c6ff70dba3265b27f7ebf1b9e2a7e504b02e95bd4496be38e3d","observation_id":"c3dae16c-8669-4071-9071-ec70cd58263b","resolution":{"observed_at":"2026-05-16T05:11:07.754859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:ceae70a3b9f589085dda6e5716a6ec49e1b65122626f336bb5f07695987763f6","observation_id":"13f301b6-4019-43c8-9146-594773c49366","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:7cb2e7511a04a67a71e8467fe5dcd5d740f4aafdbe73bc804b860e70b058a87c","observation_id":"17fc97ee-9d63-4af8-a260-448141b5ae09","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.224297Z","title":"Fast and effective on-policy distillation from reasoning prefixes","venue":null,"work_id":"6324480f-043f-4aef-84e8-9e334f9dac7a","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:f6c2c9c1f1184085b5e311527ecffd33ec23015fab8af14faa995d697cd44280","observation_id":"53b8b431-f041-4de8-bd2b-04383b565ea0","resolution":{"observed_at":"2026-05-11T03:50:57.052022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":"2604.13010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-07-04T10:19:47.155186Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","venue":"cs.LG","work_id":"7dae1a56-9dfd-4f59-a836-8c62d7da923d","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:79f88b717703a5fe9fd01ea509179827180ecf13e86fb2224eadc54455bd986e","observation_id":"3ccfe83c-a658-4419-968b-e2e7a3ce0adc","resolution":{"observed_at":"2026-05-11T03:50:57.120024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11178","last_updated":"2026-04-09T18:32:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T18:00:05Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","version":3},"cited_work":{"arxiv_id":"2603.11178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.11178","snapshot_observed_at":"2026-07-07T16:24:01.041397Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","venue":"cs.AI","work_id":"c8f1ef8c-6864-40cf-94f6-44015fe40981","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2603.11178","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:1ef2f2e66cbd48b8cf712b51774638e9d770b0dc8926ba6a131de5b8f6b52d4f","observation_id":"ac166fd2-4bc4-4dc5-a527-a3092d335569","resolution":{"observed_at":"2026-05-11T03:50:56.975858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-07-12T22:24:50.116694Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":"2604.10688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-07-04T16:09:56.987062Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","venue":"cs.LG","work_id":"c31baac4-7cbe-4749-92ac-4d4051d62ec2","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:883f0df056196b286656bf8ef9f18ac3e63214bfcc406d92d178bd4fdc361f54","observation_id":"0cdb1666-0ce7-4e54-8b02-6b795683736e","resolution":{"observed_at":"2026-05-11T03:50:56.981571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11426","last_updated":"2025-04-15T17:38:47Z","snapshot_observed_at":"2026-07-06T21:09:55.394184Z","submitted_at":"2025-04-15T17:38:47Z","title":"A Dual-Space Framework for General Knowledge Distillation of Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.11426","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.11426","snapshot_observed_at":"2026-07-04T10:19:47.106023Z","title":"A dual-space framework for general knowledge distillation of large language models","venue":null,"work_id":"8ae92514-24e2-42b9-8eca-447e86ebf1ee","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2504.11426","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:e292896c31a95a9b6877f14cae01f1ccef0402acb405f0410ee72a1a02b36ac9","observation_id":"c4eb9592-0c9e-4686-821e-2e9d6f8cd2c8","resolution":{"observed_at":"2026-05-11T03:50:57.033098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":"2603.25562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-07T12:33:45.227324Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","venue":"cs.LG","work_id":"8e059321-d6e4-4359-89eb-83ecbb93b657","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:c204089f3fd0655038833f4c5d7736a4c7691bbcce93b3eddf14d493f90c9e7e","observation_id":"cf83d039-af05-4b02-b0c9-948280a049e9","resolution":{"observed_at":"2026-05-11T03:50:57.029032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:35:05.083494Z","title":"Orpo-distill: Mixed-policy preference optimization for cross-architecture llm distillation","venue":null,"work_id":"687619d6-d6b4-40d1-913b-976047e48c9e","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:cf0ade46fe549e0a511b5f3f67d96e18001e82cc78ffa41a02b80de9bafe8d41","observation_id":"764d3480-59b6-4fe1-90e7-7fac6aec4468","resolution":{"observed_at":"2026-05-11T03:50:57.131690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02621","last_updated":"2026-04-03T01:23:04Z","snapshot_observed_at":"2026-07-06T22:51:57.889822Z","submitted_at":"2026-04-03T01:23:04Z","title":"Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2604.02621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02621","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge","venue":"cs.CL","work_id":"556651af-d321-417f-bfa0-ae347be17de8","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2604.02621","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0c84a425b280cd75fea81fe1dff28441811738ef33f751fc3992a929380611ac","observation_id":"2cfc1f61-1a71-4d0a-93c4-64ae7a3a5d02","resolution":{"observed_at":"2026-05-11T03:50:57.023922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07743","doi":"10.48550/arxiv.2510.07743","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":null,"work_id":"b59a07ee-6a84-42cb-8d41-9b665841aa2b","year":2019},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:eb2c3b58ec68cbce80591aeb511ad8d56c20f2e58168278e3ef055946d1bb259","observation_id":"e4cb5512-fa86-401c-8504-a51c65d5b16e","resolution":{"observed_at":"2026-05-11T03:50:57.061333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-07-06T22:14:21.107961Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:ad902f142e762d81b9b5e3dd4a4a9f2f77f057e12ba5f2f4d0c37de001824599","observation_id":"d3e350a5-deb2-4130-8035-99bf15500bf3","resolution":{"observed_at":"2026-05-11T03:50:57.003709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:4e309a7d7b9df2907c5113f09a35577daf083f821cbb5eebbf8dab46ef9c0744","observation_id":"7d3ee772-92f7-4318-9d8f-50158364e37d","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sibylsense: Adaptive rubric learning via memory tuning and adversarial probing","venue":null,"work_id":"9280846d-67e8-4240-be15-b411f1f14707","year":2026},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:c58a8b2a9ec42d8f873ac99e570778565828cae57a3972654a36243180d61015","observation_id":"8735ae82-eafd-43e0-a955-8390423d6677","resolution":{"observed_at":"2026-05-11T03:50:57.016436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:ed58f11d0768b5a090330434e83674a0bf0da47d575d422c8e7a76bedb05ddc8","observation_id":"96752098-7216-4ac5-b987-f6f0f0dccba0","resolution":{"observed_at":"2026-05-11T03:50:57.036401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Criterion 7: Uses proof by induction – 2/4 teachers support, 2/4 use direct computation","venue":null,"work_id":"b082511b-ad91-4be3-87a4-62d0d42c0650","year":2016},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:4c96e704a691d20c9544089b2ce51f80e6805d38c5953b6beede579305268b78","observation_id":"e308352a-22ff-4e1a-9947-ceccaba221ad","resolution":{"observed_at":"2026-05-14T13:50:58.856306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef14fd67-7fbb-4097-89bf-f5c8bdb4cd72","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:200797145e248df32c9e10cff3e314824305e1bd8dddc38c7c799fd577196e7d","observation_id":"8d3990f7-d56c-45a0-b3f6-af407dc139b5","resolution":{"observed_at":"2026-05-14T13:50:58.858393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9eaaf98-8190-437a-bf9f-65d3f5a811f2","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0909e51ff9df4736bb2d9fd2d86f37f07902f5f74d4a1d575a30f0e437a409fb","observation_id":"8816da49-4bf4-453e-baf9-07a2cca86727","resolution":{"observed_at":"2026-05-14T13:50:58.875846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d96a408d-18ed-4fff-bf0a-9965b1f7d199","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:23709ddce11fcb144614d47440e2b66f8fbf3bb92b2735b3b275867890acd2c2","observation_id":"220af574-007e-4f3f-8b06-a3f88bcb5623","resolution":{"observed_at":"2026-05-14T13:50:58.879686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67ac5a0f-38ab-4237-a436-feaf39e7999b","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:e2d3173c030c7876451a6c5754714ea453ca70547a11d8a49bf0318714f1a201","observation_id":"847d05b3-fcaf-4aa3-8129-7613a8b108d4","resolution":{"observed_at":"2026-05-14T13:50:58.873832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"051b88ee-70fe-414e-b8b6-2dce2444c373","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:4d2d3cb525a4f94a3f87adf9a8b115ac971f5c07ba365730a356032d0b27edb4","observation_id":"f712a214-bc40-4b5d-86d4-e5a86a387e8a","resolution":{"observed_at":"2026-05-14T13:50:58.895008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"# Required Category Taxonomy Your rubric should be guided by the following three categories","venue":null,"work_id":"edf05105-9912-4a56-ad6f-4bfc0164afc4","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:88078aa37c65ee0eb3cc112c73784140b73025dce65ee164e882c34227edb06b","observation_id":"291ec9ba-9f88-4ea4-a0e6-94e9927d7f79","resolution":{"observed_at":"2026-05-14T13:50:58.871611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes identifying the target quantity, presenting the answer explicitly, and meeting format requirements","venue":null,"work_id":"257f8458-4d32-4fae-bf65-65a32fc3b171","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:2c3cd02205d4cbae1971060b05c5ceebd878d52d5d62ed32eab2e32216c4c876","observation_id":"9c4e79a8-ed7f-4fca-b28b-c36d0eb06126","resolution":{"observed_at":"2026-05-14T13:50:58.882192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"368424df-1514-43ca-9cf2-360529f037e5","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0e4e1569013f8d5a62757e042adb3699c5bdb7e6e06f0ff5cce820150ebd2aee","observation_id":"ef2c2978-f2c2-4f91-900e-4ffe001640cb","resolution":{"observed_at":"2026-05-14T13:50:58.860241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Use this category when such qualities are genuinely relevant and improve teacher-student separation","venue":null,"work_id":"644b7c2a-7de1-4ff7-bf37-30f8d556d491","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:45b4a745d714b2910bd4686f955956beb7b43bd7c9b0408bca4ba95ee63ff2f4","observation_id":"925f69da-fc1c-4872-9701-2d315381ad0b","resolution":{"observed_at":"2026-05-14T13:50:58.877859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0347813a-591e-4f44-a9a4-83638a98ace5","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0b614790df0bcfa3b671d725fb9e87447106ebcc9b1e1ef059315b84042c9c03","observation_id":"a9910725-0378-4558-9bb3-92f30516c246","resolution":{"observed_at":"2026-05-14T13:50:58.897191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c6200ee-6a42-4124-b60e-e61ff810a699","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:2538881140c67479f178b9a34ac487424b167702f84ca460ce2d94767bd7633f","observation_id":"aa44c6bd-7f7c-401c-9e4f-bc3a6df0f8ed","resolution":{"observed_at":"2026-05-14T13:50:58.884806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bae7ebbc-aae9-413c-855d-d47d574edcaa","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:14442f082eed68730fdc9a18caa1d4ff9c7a489c5e899dc79822fd1552fd92b4","observation_id":"0b3fdef9-43fe-44c8-b136-e711acbeba39","resolution":{"observed_at":"2026-05-14T13:50:58.862630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8e0b6154-7a92-4870-b7c0-71e3d1a47a19","year":null},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:06965d4409930bcd51e0a9da810b7fa6d9eb909cf5d641eb5a62b03ab47be21a","observation_id":"4eec8d6a-dbfe-4d88-9084-aca72a65d356","resolution":{"observed_at":"2026-05-14T13:50:58.889328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"uses the same method as the teacher(s)","venue":null,"work_id":"fd91f5b3-f3ad-4c30-8ae0-19c04d9cc63c","year":2024},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:0b82622958f526e707b4e39438e563c8a4c0b26594553fdd07b0fa5bce416c39","observation_id":"9d89d275-ac8f-464d-920d-99de83e3544e","resolution":{"observed_at":"2026-05-14T13:50:58.887123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":10,"verified_exact":28,"verified_fuzzy":13},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 11 inbound Pith citation observations for arXiv:2605.07396."}