{"as_of":"2026-07-30T12:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93f40bf238da3bfe6a7ca6977c763ef91ddaf6c9df531551326e6d8cee62d004","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T07:24:22.355378Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-30T06:33:22.917629+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T05:51:18.037199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T05:54:18.602535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2605.21924","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-06-30T05:54:18.602535Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","venue":"cs.CV","work_id":"7878d8aa-b596-472b-81ee-0e5cd291c651","year":2026},"citing_paper":{"arxiv_id":"2606.30626","last_updated":"2026-06-29T17:55:53Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-29T17:55:53Z","title":"DOPD: Dual On-policy Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T05:51:18.037199Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2606.30626"},"observation_digest":"sha256:f357119cd9dca83101c4833b4c0cdd23f208260bb00960c18650c1accc7939ba","observation_id":"6ec24019-afb0-4680-98cf-7d0137eb90e3","resolution":{"observed_at":"2026-06-30T05:54:18.604225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.21924/citation-record","integrity":"/paper/2605.21924/integrity","json":"/paper/2605.21924/citation-record.json","paper":"/paper/2605.21924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.522565Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"3733ff2d-cd95-4776-9fa9-1b2328326749","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:f00809385d85b430d751d4abf55311fd3727dd09c734321ffb70487c8d41269e","observation_id":"57559873-2a57-4dc0-8753-5044f14c5556","resolution":{"observed_at":"2026-05-22T07:24:43.538432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.575750Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"b1e6b0f6-8514-45e3-8ada-200c47bc849c","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:aba52f863df7fe4641c98e6ff590e77ed4cebc03d5564e9ba0dd94248e437303","observation_id":"013e0229-9e32-47fc-af7c-5315f2ddd62b","resolution":{"observed_at":"2026-05-22T07:24:43.544402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":"2602.12125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-09T00:35:48.740330Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","venue":"cs.LG","work_id":"bb968107-1f43-4bf4-aa52-cc58000a6e89","year":2026},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:78d96c70f38cc067f42fdb39cce879ed647379aef7d82731a85745c0641f26d2","observation_id":"aa5096a4-7941-4869-95dd-7cba8386883a","resolution":{"observed_at":"2026-05-22T07:24:42.884307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-07-06T17:26:10.790336Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.03898","doi":"10.48550/arxiv.2402.03898","metadata_source":"pith","pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Distillm: Towards streamlined distillation for large language models.ArXiv, abs/2402.03898","venue":"cs.CL","work_id":"aebc3613-3aa4-4807-b7a7-c7496f1d7f34","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:f9368c818049334e538f64da09686c34caee540c33a76f4b374302d3d7c78dea","observation_id":"7c5fbd27-8657-4e24-8198-00f7d6280272","resolution":{"observed_at":"2026-05-22T07:24:42.929750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:fb35c993e9df2cf319e0cf28843f44bf55817f0d7c920b5ca4addb9d81c4a6a1","observation_id":"888c5264-6fa5-44ce-986d-090b55c4b6e6","resolution":{"observed_at":"2026-05-22T07:24:42.939849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"f3b0d6e9-6ab7-467d-a448-64d63daae254","year":2021},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:2f630380cded2fe2facfe28f8042227c8e0940573122e83d253b344a0edbd884","observation_id":"aee4b324-9c80-4536-ba4f-e7242736c636","resolution":{"observed_at":"2026-05-22T07:24:43.534503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.08837","doi":"10.48550/arxiv.2504.08837","metadata_source":"pith","pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-07-11T03:17:51.945581Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","venue":"cs.LG","work_id":"b13ff087-9614-48cc-8991-ad75b6543bbc","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:3dfe6a07eb3574a268698099499cd3e0d7d38081782295794ed2543f1e263cdd","observation_id":"e01efe42-27d9-4c62-8c42-b61f8cee2516","resolution":{"observed_at":"2026-05-22T07:24:42.961954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:5da0e872670fb2655f1a49303b347bcdb984eb70b0534df3430036657b93bde7","observation_id":"8005a4f9-3d78-45ee-9715-6d428831ed0e","resolution":{"observed_at":"2026-05-22T07:24:42.973997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:2c25134eaa03fa210d0f82ed88d5b7104db8ace81c17b5553d934078f75d1dc5","observation_id":"8be8682c-5803-4ea4-97b1-6ef7587c8a4a","resolution":{"observed_at":"2026-05-22T07:24:42.968011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:764b5e7785736204c4b70cf5b83440c95a2984649a3184cab1ae2ab37a525575","observation_id":"730a824b-9a15-4357-8ae9-130108c9edc3","resolution":{"observed_at":"2026-05-22T07:24:42.923599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:8faca31ebec9708080be01b211aa8805fe5fe9af3c4828538c7d015e0cd947f5","observation_id":"1b19c7b6-e00e-4fa5-af0a-58120a41237f","resolution":{"observed_at":"2026-05-22T07:24:42.901472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:d55940a44a1808024853f359c6fc62ca122e025df5748bcf8f4c659cdd585f7d","observation_id":"f76cbc4b-0cf9-4835-be48-443c2b0427ec","resolution":{"observed_at":"2026-05-22T07:24:42.945811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.444456Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":"251b3b47-9f69-4aa6-8791-f94ad8a40cc2","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:6ea48c38ee99f2b432bfb4a540bb6253c278f5d553952c25c6555d049e7a70a2","observation_id":"5db27f69-3c9f-4d38-8b28-8cea840df618","resolution":{"observed_at":"2026-05-22T07:24:43.519778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"e52daaca-a73f-4748-a9db-a6830600a992","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:1aade534207c3c54779f7ac3f456fdca107a39ed902934ebaed149fcc67f709a","observation_id":"00a5a185-29ef-4b77-bced-94cd9a4bfbf6","resolution":{"observed_at":"2026-05-22T07:24:43.527512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.734242Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"267d76bf-96fe-4408-81fc-0e04005d4092","year":2016},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:a56a9afddb9ef8d9ceb30f3bf3f2cabe983a7f0450733020bc47420441ffcd8f","observation_id":"caf7152e-1ab1-48b8-b867-447713b8f377","resolution":{"observed_at":"2026-05-22T07:24:43.530864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:45:00.507882Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"379af22d-41e1-4dcd-90ed-ba12a2ce31f5","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:60b24679f3cced86739b0bf059b7aee7874ff0263dbbadf0a860c03c46148a0c","observation_id":"aa3e59f3-790a-4a9d-96cf-36596968c0fc","resolution":{"observed_at":"2026-05-22T07:24:43.558486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.524628Z","title":"Are we on the right way for evaluating large vision- language models?Advances in Neural Information Processing Systems, 37:27056–27087","venue":null,"work_id":"0321ac45-cb4e-410a-9e7f-4ce338ef022b","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:ad5b1a32b46c133b28473d34155cb27242bdd9d36f62dff5b0554b2e0ef638dd","observation_id":"e3750704-5ce0-4b95-b317-7ad0c7351e45","resolution":{"observed_at":"2026-05-22T07:24:43.562087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.750635Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102","venue":null,"work_id":"6874ca05-573e-491c-ae2c-269f7ae4bfa6","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:f54c292939cfc49cd4b505adea74fca8623577c30baf2e54b270a1ea4a0f955a","observation_id":"ff1efb2c-c145-42b1-839e-568be0d64260","resolution":{"observed_at":"2026-05-22T07:24:43.570267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"a576614b-fb2e-4b0f-80cf-b3e0b8c8cca4","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:38fd05e0a726efc5f7ab37ddebcb63257066890a60ca01e9703020757c77e7d8","observation_id":"c3462313-02a8-417a-911e-ae6131e2ce0a","resolution":{"observed_at":"2026-05-22T07:24:43.565704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"07341c40-0f2d-4fa9-9bef-adc6436eb58c","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:170c8daabb22c254dfba69b17c6f1982f5c995f3e76796360fa606a0debb6033","observation_id":"e9832a10-f06f-496a-966b-f151860241c1","resolution":{"observed_at":"2026-05-22T07:24:43.555019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15683","last_updated":"2025-03-06T03:59:59Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:21:59Z","title":"Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs","version":3},"cited_work":{"arxiv_id":"2405.15683","doi":"10.48550/arxiv.2405.15683","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.15683","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Visual description grounding reduces hallucinations and boosts reasoning in lvlms","venue":null,"work_id":"482daa7f-0dd5-4b17-9d82-0941eaa182cb","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2405.15683","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:4223b4cf810b462a18a83abf7e09434c8dc353a2f83fbf8c6c12d2270edb66c9","observation_id":"34958356-7e2e-4cce-951d-a757cadab9ac","resolution":{"observed_at":"2026-05-22T07:24:42.912926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.681904Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization","venue":null,"work_id":"4b4f4775-49d2-47b2-bfbd-f73a781d8ece","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:fd0bbef16f3cf1c8e4831e2b85f322c8fc331ad8f828b20164d8695d981cc572","observation_id":"f803e542-6f41-4534-91c7-a63396146e47","resolution":{"observed_at":"2026-05-22T07:24:43.547814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:62e3872f1f193fae83a3f8d5eb15966c433119fe4e857c518207f96bf4e314cc","observation_id":"b8713252-d2d9-4d04-97b3-73766edbde3a","resolution":{"observed_at":"2026-05-22T07:24:42.889722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding","venue":null,"work_id":"f2fffa7e-a9c4-4474-a940-c06e43b6613c","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:77d64cfc9262cf11eb3de95f1bd7c9a7210ea69e29765d796ea31c844aedb836","observation_id":"e246103d-1dfb-489a-a35f-d02c0f80c8f6","resolution":{"observed_at":"2026-05-22T07:24:43.551515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.14487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation","venue":null,"work_id":"43c5bc40-df74-44f8-854b-8f107f58e979","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:34c3ddaf9197c463739ab740f1e8d9ab9cf0975f932a2d3beef0d34f31f4a29f","observation_id":"5194f307-16ab-49f9-940c-f4bfb160999b","resolution":{"observed_at":"2026-05-22T07:24:42.907761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:47:23.083361Z","title":"Spotlight on token perception for multimodal reinforcement learning","venue":null,"work_id":"e036d6a7-44ee-4996-88fa-d3380e887a67","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:9ff410e0ce1e4ca1b392c7cc275d821dffdd993a0be0a05b79f706e47d93a0e5","observation_id":"921e3ae4-68e3-47cc-a0e5-8cc3f47e821c","resolution":{"observed_at":"2026-05-22T07:24:42.918798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking token-level policy optimization for multimodal chain-of-thought","venue":null,"work_id":"23bf6896-ed55-4740-93f9-1fdd298ab2f7","year":2026},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:3005eda80fa1ff9ab6ce0c412707c476b9f0a73bbd2fef73944d3fad17ff2979","observation_id":"5d371482-c469-4a26-8dab-dbb0b4d7fe08","resolution":{"observed_at":"2026-05-22T07:24:42.956937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:10:08.047045Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":"a7902913-6e82-44c4-a2ee-1dc0a61e41d1","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:a8c411f45eaf0802aab87011a024d86cb3e2609f5b51c49ecd88085c1d89815f","observation_id":"af1aefb4-1f19-4ef4-a049-9c6da5593db9","resolution":{"observed_at":"2026-05-22T07:24:42.895332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking kullback-leibler divergence in knowledge distillation for large language models","venue":null,"work_id":"fe365e10-8a2d-446a-9546-7208bbb0c591","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:a20c476efe2570a0de511868e2b52460b7e382f0267256ae195e41d6dc50f611","observation_id":"1a57432b-5303-4b59-a980-a052d79d3125","resolution":{"observed_at":"2026-05-22T07:24:43.523847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":"2603.07079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-09T21:06:34.837233Z","title":"Entropy-aware on-policy distillation of language models","venue":"cs.LG","work_id":"7dccbe12-e2aa-48d8-9b76-5521ccf02668","year":2026},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:10ac4dbfaf0a2a8b5eb6b038c97dffe2fe5f91216b7e07cec7c2c5d58a3bdd29","observation_id":"9d9cf732-09dd-4463-9940-65546755eadc","resolution":{"observed_at":"2026-05-25T03:02:00.585154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11325","last_updated":"2025-04-27T23:18:29Z","snapshot_observed_at":"2026-07-06T19:33:39.134036Z","submitted_at":"2024-10-15T06:51:25Z","title":"Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling","version":3},"cited_work":{"arxiv_id":"2410.11325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11325","snapshot_observed_at":"2026-07-07T12:33:45.177059Z","title":"Speculative knowledge distillation: Bridging the teacher-student gap through interleaved sampling","venue":"cs.CL","work_id":"ea44f5cb-864a-432c-8890-136a97a37566","year":2024},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2410.11325","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:2e250a58892f01ba34b0ebd05af6be871c2bd571a883bee1adb977e1f84408c5","observation_id":"1b7bc637-9aed-4d75-b525-4857ce2f19a8","resolution":{"observed_at":"2026-05-22T07:24:42.979381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-policy distillation","venue":null,"work_id":"c201ee2f-cb36-4574-a9f9-c86bb4d1ed30","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:a2255df1c1c33a77c06d69a4bc48dde0a582592352fe3e1ccf6bea866b8de9d3","observation_id":"6fc31c0c-aadc-4534-9ba9-eb0689295ab3","resolution":{"observed_at":"2026-05-22T07:24:43.541497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T07:24:22.355378Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2605.21924"},"observation_digest":"sha256:42a3d08986d7e8ebac8f00b62c70c24fa01aa5baba9b97343959f72d241935a6","observation_id":"ba133aa1-9274-48c1-862d-c427a72288bd","resolution":{"observed_at":"2026-05-22T07:24:42.951553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-30T06:33:22.917629+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":15},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-30T06:33:22.917629+00:00","source":"crossref"},{"observed_at":"2026-07-30T06:33:09.801887+00:00","source":"retraction_watch"}],"thesis":"As of 30 July 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2605.21924."}