{"as_of":"2026-08-17T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65b3886d3175e2c8bb795f9070c2c4c6b36938b1b95234d2ddeff85942048796","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:09:59.059091Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22334/citation-record","integrity":"/paper/2607.22334/integrity","json":"/paper/2607.22334/citation-record.json","paper":"/paper/2607.22334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:53.533128Z","title":"DeepSeek-V4: Towards highly efficient million-token context intelligence.arXiv preprint arXiv:2606.19348, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:53.533128Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:12f0ab1a01dfa421a764a46bdc2ddd21be20a7380be7ad7ed03a61754d9c790b","observation_id":"7365310a-3fd2-4c91-8c37-fd463320a0db","resolution":{"observed_at":"2026-08-01T05:09:53.533128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T05:09:53.635437Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:53.635437Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:8b4cb9110db0a4e1e6a6e812efa19c20092b7315b772b22c5d3e498ffb93fe13","observation_id":"cd133846-5c22-46e3-81f8-834ca7928f53","resolution":{"observed_at":"2026-08-01T05:09:53.635437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-01T05:09:53.769900Z","title":"Kimi K2.5: Visual agentic intelligence.arXiv preprint arXiv:2602.02276, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:53.769900Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:49e45bd7e0e0407a4acdf2a23596f6dbfb6e1dd819e2e9da617a094e046c1626","observation_id":"d732594f-48e5-4513-b631-3cb6958b0350","resolution":{"observed_at":"2026-08-01T05:09:53.769900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T05:09:53.931917Z","title":"GLM-5: From vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:53.931917Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:28ceb501f3cd553118b44b8a05ac7dd30ea1faa72f7127b91806793313d96c97","observation_id":"81c5069c-e91b-4c36-a4f3-c63f21e7e327","resolution":{"observed_at":"2026-08-01T05:09:53.931917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26494","last_updated":"2026-07-30T05:04:36Z","snapshot_observed_at":"2026-08-09T08:07:15.140139Z","submitted_at":"2026-05-26T03:16:11Z","title":"The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26494","snapshot_observed_at":"2026-08-01T05:09:54.047136Z","title":"The MiniMax-M2 series: Mini activations unleashing max real-world intelligence.arXiv preprint arXiv:2605.26494, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.047136Z"},"links":{"cited_paper":"/paper/2605.26494","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:35566f91ab582ee4eeb57813be901012d292dbeaa9a32fc70e0ba7a7a58d5e9b","observation_id":"1a63bafd-7342-4889-abcf-deb3614d4e54","resolution":{"observed_at":"2026-08-01T05:09:54.047136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-16T15:26:41.664301Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-01T05:09:54.163495Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion.arXiv preprint arXiv:2306.02561, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.163495Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:d78c074b5022b7ae586a2c3124fdf05eca00b4a87a67d9ff3024d4c3e3ca7dbd","observation_id":"0adee1f2-c634-4bcc-936b-efa9db5f12d7","resolution":{"observed_at":"2026-08-01T05:09:54.163495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-01T05:09:54.301356Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.301356Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:6367f35a74d1108031b625ac089068f9775ac90d884c418a517b02cb935ae263","observation_id":"b073561a-6b0e-484c-b24f-275b34df8314","resolution":{"observed_at":"2026-08-01T05:09:54.301356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:54.378833Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.378833Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:21e283005c2babe2a548dc28f0be246fee7fc747af35727525c971e8a96cba7b","observation_id":"527674ce-8624-44b4-8ec2-8cc884a1d5c7","resolution":{"observed_at":"2026-08-01T05:09:54.378833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-01T05:09:54.527286Z","title":"A survey on knowledge distillation of large language models.arXiv preprint arXiv:2402.13116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.527286Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:cffe990a0a5f99d7c7919d5e59791cfbe36dbf1bf79fa513e8bd855309aa5523","observation_id":"cda1910b-de80-4f2f-9f09-97e572c4c9bc","resolution":{"observed_at":"2026-08-01T05:09:54.527286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-17T02:17:22.510859Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-01T05:09:54.664811Z","title":"Merrill, Tatsunori Hashimoto, Yejin Choi, Jenia Jitsev, Reinhard Heckel, Maheswaran Sathiamoorthy, Alexandros G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.664811Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:c93e61ab0a5c134cb00e4a7cbbff775f05d3d837a9749a8b5c971481386219c4","observation_id":"f81e3e9e-4a8e-4a08-86bf-c0fb9218fe01","resolution":{"observed_at":"2026-08-01T05:09:54.664811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:54.798840Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.798840Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:635843a34afea41da1e46377732419a2c83595eaef089d65f9fb9c2d07cfd279","observation_id":"d5a86de0-e4b1-4f4a-ab34-0afde5bdb373","resolution":{"observed_at":"2026-08-01T05:09:54.798840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:54.890205Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:54.890205Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:b3bf835ab53df4153d86aee09a5e8abfd4d7a8a9337f6e881685c6c13126f74d","observation_id":"fdaad184-6460-44df-b9c0-ad2ca4e56ba6","resolution":{"observed_at":"2026-08-01T05:09:54.890205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01171","last_updated":"2023-01-09T23:49:03Z","snapshot_observed_at":"2026-08-17T19:55:16.506876Z","submitted_at":"2022-04-03T22:28:31Z","title":"Why Exposure Bias Matters: An Imitation Learning Perspective of Error Accumulation in Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01171","snapshot_observed_at":"2026-08-01T05:09:55.005940Z","title":"Why exposure bias matters: An imitation learning perspective of error accumulation in language generation.arXiv preprint arXiv:2204.01171, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.005940Z"},"links":{"cited_paper":"/paper/2204.01171","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:e556f9750e63fca96bf1b88df741df2e18357bbfd4b9a44d23864632a2755a8b","observation_id":"8a5326e0-a48e-4338-b044-6408ba749207","resolution":{"observed_at":"2026-08-01T05:09:55.005940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-14T14:15:55.861698Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-01T05:09:55.079840Z","title":"Skill-sd: Skill-conditioned self-distillation for multi-turn llm agents.arXiv preprint arXiv:2604.10674, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.079840Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:fceb33326692f84dd32012ff902a7da883a5868d36dad19ed86b9b02cb7ae08c","observation_id":"272defbe-fce9-4c99-8b44-7479c8f90254","resolution":{"observed_at":"2026-08-01T05:09:55.079840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.134239Z","title":"On-policy distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.134239Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:1d17f11635d2e254ba6ebd60dfe2adfd5b358324141c13ab0df16ca6ba062296","observation_id":"ad52218a-d094-48cc-952d-aa95dcbbd88e","resolution":{"observed_at":"2026-08-01T05:09:55.134239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13555","last_updated":"2025-02-18T00:14:57Z","snapshot_observed_at":"2026-08-16T13:41:26.708487Z","submitted_at":"2024-06-19T13:44:56Z","title":"BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13555","snapshot_observed_at":"2026-08-01T05:09:55.240305Z","title":"Bild: Bi-directional logits difference loss for large language model distillation.arXiv preprint arXiv:2406.13555, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.240305Z"},"links":{"cited_paper":"/paper/2406.13555","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:d38e8e19cfee24ac9694ba5dfcf806f26bd07c6de2e92d0f6e1a6ceab5e347f8","observation_id":"f5cdebac-d1de-45e6-9fb7-be2a05d6d840","resolution":{"observed_at":"2026-08-01T05:09:55.240305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16870","last_updated":"2025-07-24T17:30:12Z","snapshot_observed_at":"2026-08-16T12:48:03.690038Z","submitted_at":"2025-03-21T05:58:18Z","title":"Sparse Logit Sampling: Accelerating Knowledge Distillation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16870","snapshot_observed_at":"2026-08-01T05:09:55.300776Z","title":"Sparse logit sampling: Accelerating knowledge distillation in llms.arXiv preprint arXiv:2503.16870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.300776Z"},"links":{"cited_paper":"/paper/2503.16870","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:703992720bea6c35ed391104cbf6246d02e9ff17b49618f6f0d170bfed92581d","observation_id":"51619f70-3fcf-447a-ad0a-4b3ac0ab41f9","resolution":{"observed_at":"2026-08-01T05:09:55.300776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-01T05:09:55.353518Z","title":"Neural machine translation of rare words with subword units.arXiv preprint arXiv:1508.07909, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.353518Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:b8e26d9b9af05587638d371a7c8eb2cf132dbc269ef888004baef7b1b4dab812","observation_id":"ca6ac455-a2cd-4ba8-aa96-7ad343eeced6","resolution":{"observed_at":"2026-08-01T05:09:55.353518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-08-16T18:55:05.983035Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-01T05:09:55.425532Z","title":"How good is your tokenizer? on the monolingual performance of multilingual language models.arXiv preprint arXiv:2012.15613, 2021","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.425532Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:4d975da8f5a82b4c30c7756aab5a7d2678426be798ce9d48274468cc2d61cfa9","observation_id":"6fb29719-9e50-4869-8026-579ac0f0fa82","resolution":{"observed_at":"2026-08-01T05:09:55.425532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.503962Z","title":"Knowledge fusion of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.503962Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:f28ac00a58a71e93aa84fd77185b5c02c6f4efba14667ce2796fdec1d9b093c2","observation_id":"61d92b1d-ed4a-45c7-bb69-b3e5b8ca639c","resolution":{"observed_at":"2026-08-01T05:09:55.503962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.568202Z","title":"Towards cross-tokenizer distillation: the universal logit distillation loss for llms.Transactions on Machine Learning Research (TMLR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.568202Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:e05e744ac4b60d8aa96d0688468c99272e8aa453548aa0173223c43bd7b015d5","observation_id":"8613df07-739b-43dd-b405-1fc16399a90c","resolution":{"observed_at":"2026-08-01T05:09:55.568202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.629341Z","title":"Dual-space knowledge distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.629341Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:6cb59b4008d216982ca60b6f5a27e5e2e05eabb1ef9b9abeb1e428ac8190df83","observation_id":"bf2922a7-ccca-4997-a30b-d8fe8f6cbf35","resolution":{"observed_at":"2026-08-01T05:09:55.629341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.708924Z","title":"Multi-level optimal transport for universal cross-tokenizer knowledge distillation on language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.708924Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:91740bf906c30ade65a683d28f8e55177483312f051b537ea5df976ed6a04caa","observation_id":"10b8f234-55a3-46d7-b704-aea56a737970","resolution":{"observed_at":"2026-08-01T05:09:55.708924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.713114Z","title":"Universal cross-tokenizer distillation via approximate likelihood matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.713114Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:b430aaeddca3012080bb4422e53735c7878fd60d78a99a89357f4ec9963bfab1","observation_id":"0743f326-d772-4821-a0d3-8dc764e0d8e9","resolution":{"observed_at":"2026-08-01T05:09:55.713114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:55.735867Z","title":"Unlocking on-policy distillation for any model family","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.735867Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:aff67879c689b18d346c18eeb312e7ee2843da083ee71b470d05bd7396e2c1f6","observation_id":"f13018a2-51e7-4c16-b525-ed7205e2ef1c","resolution":{"observed_at":"2026-08-01T05:09:55.735867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07711","last_updated":"2026-05-21T08:28:27Z","snapshot_observed_at":"2026-08-13T10:28:04.584789Z","submitted_at":"2026-05-08T13:16:17Z","title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07711","snapshot_observed_at":"2026-08-01T05:09:55.790864Z","title":"Simct: Recovering lost supervision for cross-tokenizer on-policy distillation.arXiv preprint arXiv:2605.07711, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.790864Z"},"links":{"cited_paper":"/paper/2605.07711","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:58fbe21b0d6ace731ac7cfac8c1d95ac4d0481c851affb5ac24be2dfa42cec33","observation_id":"bb2ee1b5-0e33-4e06-b1bf-8d1bf51b2bc3","resolution":{"observed_at":"2026-08-01T05:09:55.790864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06874","last_updated":"2022-05-18T17:42:09Z","snapshot_observed_at":"2026-08-16T18:39:32.225618Z","submitted_at":"2021-03-11T18:57:44Z","title":"CANINE: Pre-training an Efficient Tokenization-Free Encoder for Language Representation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06874","snapshot_observed_at":"2026-08-01T05:09:55.843624Z","title":"Clark, Dan Garrette, Iulia Turc, and John Wieting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.843624Z"},"links":{"cited_paper":"/paper/2103.06874","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:652418042288bca28270e55c03464d569b0eef3256c49db6ceb083a07ee006ad","observation_id":"b0df1043-0977-4429-9a4c-38758d5fdf71","resolution":{"observed_at":"2026-08-01T05:09:55.843624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13626","last_updated":"2022-03-08T02:18:51Z","snapshot_observed_at":"2026-08-16T18:21:34.850129Z","submitted_at":"2021-05-28T07:03:22Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13626","snapshot_observed_at":"2026-08-01T05:09:55.905970Z","title":"Byt5: Towards a token-free future with pre-trained byte-to-byte models.arXiv preprint arXiv:2105.13626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.905970Z"},"links":{"cited_paper":"/paper/2105.13626","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:c22d76e737a21ff9da63fca085405dd4c1f0e96cfd4ce988b68560c635ef5a1c","observation_id":"7eb94844-1438-4a36-896f-bf3b19ecfd0a","resolution":{"observed_at":"2026-08-01T05:09:55.905970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07185","last_updated":"2023-05-19T21:09:11Z","snapshot_observed_at":"2026-08-16T15:33:42.352919Z","submitted_at":"2023-05-12T00:55:41Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07185","snapshot_observed_at":"2026-08-01T05:09:55.974479Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers.arXiv preprint arXiv:2305.07185, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:55.974479Z"},"links":{"cited_paper":"/paper/2305.07185","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:2d649fe36e60aa0492a96a1d079617b4b785810d5d7450b7faf3c9ddaa22171d","observation_id":"88ffc778-30f8-497c-b9b9-12c6a14425af","resolution":{"observed_at":"2026-08-01T05:09:55.974479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-15T13:45:11.226724Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-01T05:09:56.046733Z","title":"Byte latent transformer: Patches scale better than tokens.arXiv preprint arXiv:2412.09871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.046733Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:9de757b4aeaf2873a82fd7ea16d57a02e28198cfdd22adbed74e0c3740d792e3","observation_id":"0799d3ef-482e-4656-ad44-e5616d0dca69","resolution":{"observed_at":"2026-08-01T05:09:56.046733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:56.131433Z","title":"FitNets: Hints for thin deep nets","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.131433Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:601b67188c3a3ab6476797053c9b0576420bf3024e6faf7123512ba9a49e6daf","observation_id":"5e3a80e7-f55b-4e8f-8fe7-d341e0f8bbeb","resolution":{"observed_at":"2026-08-01T05:09:56.131433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:56.235298Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.235298Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:350e940ee71d48ee8aa984b894b7f08c16dc47b3c174de1557226716785b4f25","observation_id":"e9ed172f-9016-49fd-810c-348419d1b448","resolution":{"observed_at":"2026-08-01T05:09:56.235298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-08-16T16:08:09.810307Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-01T05:09:56.295699Z","title":"Teaching small language models to reason.arXiv preprint arXiv:2212.08410, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.295699Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:f1058ef4ff32fe61064810fbbfca7a8b42edddb3fcea97ece7ef1e6805788f30","observation_id":"fa2c8231-2f81-4080-b0bc-d11294536dc0","resolution":{"observed_at":"2026-08-01T05:09:56.295699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-16T13:06:53.834278Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-08-01T05:09:56.368774Z","title":"Miniplm: Knowledge distillation for pre-training language models.arXiv preprint arXiv:2410.17215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.368774Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:66539bf40f3ed56d74dd5de6f7fcce1a0cc5e467bb623885d5350aff17db9c86","observation_id":"ab4e288a-da65-491c-bd02-cdaba873ad08","resolution":{"observed_at":"2026-08-01T05:09:56.368774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:56.432066Z","title":"UI-Genie: A self-improving approach for iteratively boosting MLLM-based mobile GUI agents.Advances in Neural Information Processing Systems, 38:150376–150411, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.432066Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:c5b7d6f1d870e459dd34825ea8f2896413bd74195c57b48d88715fe2eb1a3da2","observation_id":"c0bcfb11-c700-4e58-b363-fce44f7f7460","resolution":{"observed_at":"2026-08-01T05:09:56.432066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:56.510436Z","title":"UI-Mem: Self-evolving experience memory for online reinforcement learning in mobile GUI agents.arXiv preprint arXiv:2602.05832, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.510436Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:b6064aa1bcc39c75c8b1a180f6e31ff6843b1258eca6f7b4488c659eab1b70fe","observation_id":"f83b293e-534a-4639-9eb0-8e576f0e6f5e","resolution":{"observed_at":"2026-08-01T05:09:56.510436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07253","last_updated":"2020-10-29T00:40:45Z","snapshot_observed_at":"2026-08-03T18:52:39.630483Z","submitted_at":"2020-09-15T17:43:02Z","title":"Autoregressive Knowledge Distillation through Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07253","snapshot_observed_at":"2026-08-01T05:09:56.603324Z","title":"Autoregressive knowledge distillation through imitation learning.arXiv preprint arXiv:2009.07253, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.603324Z"},"links":{"cited_paper":"/paper/2009.07253","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:f40825629ec87a827c9009f437e6da8cd486243c108f5ed8061fc8eb08ba9ea4","observation_id":"a2658691-8d2b-48c8-8943-49620fac2b62","resolution":{"observed_at":"2026-08-01T05:09:56.603324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-01T05:09:56.726567Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.726567Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:31352363e4db3fdf20268aca567410b012a25019c9d6851e441d591ed1975a06","observation_id":"30c9e008-8908-450b-ab97-922d712edb80","resolution":{"observed_at":"2026-08-01T05:09:56.726567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15190","last_updated":"2023-07-27T20:39:06Z","snapshot_observed_at":"2026-08-17T13:07:48.501709Z","submitted_at":"2023-07-27T20:39:06Z","title":"f-Divergence Minimization for Sequence-Level Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15190","snapshot_observed_at":"2026-08-01T05:09:56.818777Z","title":"f-divergence minimization for sequence-level knowledge distillation.arXiv preprint arXiv:2307.15190, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.818777Z"},"links":{"cited_paper":"/paper/2307.15190","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:c95832867152077bd51ce0a74c355962bbcbf22216f5b0f08e8ff76acb1acb89","observation_id":"d44d2cca-4c3d-458d-a8bd-74958138efe8","resolution":{"observed_at":"2026-08-01T05:09:56.818777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-16T14:21:03.535260Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-01T05:09:56.913028Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:56.913028Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:29b9ef7ca030a32762639e29cb2575ee65d8301b896d4b357cdf825b75d9c49f","observation_id":"1488b820-6824-4687-954a-28e0b376173d","resolution":{"observed_at":"2026-08-01T05:09:56.913028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07067","last_updated":"2025-05-30T04:41:12Z","snapshot_observed_at":"2026-08-16T12:51:37.093376Z","submitted_at":"2025-03-10T08:51:32Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07067","snapshot_observed_at":"2026-08-01T05:09:57.003341Z","title":"Distillm-2: A contrastive approach boosts the distillation of llms.arXiv preprint arXiv:2503.07067, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.003341Z"},"links":{"cited_paper":"/paper/2503.07067","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:c0f4f7eb95ba4855c7432406fd36d25f0f75625020288e75ef7706afb9145eee","observation_id":"3d6f254f-e089-4adb-9c95-cab409fa0e1f","resolution":{"observed_at":"2026-08-01T05:09:57.003341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.089734Z","title":"Kat-coder-v2 technical report.arXiv preprint arXiv:2603.27703, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.089734Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:f52b710a21a27e5621b34eaf1f2937fcb030a22538282d3082d41359f23bb0d0","observation_id":"657b184c-c03f-4705-abdc-5f2e6df97b51","resolution":{"observed_at":"2026-08-01T05:09:57.089734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05471","last_updated":"2026-07-06T08:14:02Z","snapshot_observed_at":"2026-08-14T20:52:59.112956Z","submitted_at":"2026-07-06T08:14:02Z","title":"KAT-Coder-V2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05471","snapshot_observed_at":"2026-08-01T05:09:57.178180Z","title":"Kat-coder-v2.5 technical report.arXiv preprint arXiv:2607.05471, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.178180Z"},"links":{"cited_paper":"/paper/2607.05471","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:f0734fe43078edd98fc8539bc4be0f8a6ddc54c364ebb6868fca9fc89f1e1a2e","observation_id":"8105933d-2a93-4051-9f85-ec9be90217da","resolution":{"observed_at":"2026-08-01T05:09:57.178180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.271305Z","title":"Zero-shot tokenizer transfer.arXiv preprint arXiv:2405.07883, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.271305Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:fa2e1c71b969ff91a389955828d959dfec97f37e8c97b11d9fd868c366d31cce","observation_id":"cc0f357e-8c9d-4fec-afe6-be75c3e4bd2d","resolution":{"observed_at":"2026-08-01T05:09:57.271305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.340958Z","title":"Breaking the ceiling of the LLM community by treating token generation as a classification for ensembling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.340958Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:8df07368b1cc85178abefc71ca0a8b90b56c0617ac2185f97db5e47ca3a3f367","observation_id":"b9bb61d4-4cc3-4a03-a2d2-35d7922e6dd9","resolution":{"observed_at":"2026-08-01T05:09:57.340958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.395365Z","title":"Bridging the gap between different vocabularies for LLM ensemble","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.395365Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:8948ef0dab6f611f02334a4ae1fcc5a3792872f3401eb450157e18a7cea68fbe","observation_id":"22109fd3-12b5-4ee2-8a50-58873c3837ea","resolution":{"observed_at":"2026-08-01T05:09:57.395365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03777","last_updated":"2025-02-25T12:40:51Z","snapshot_observed_at":"2026-08-16T13:13:03.207171Z","submitted_at":"2024-10-03T08:42:38Z","title":"Determine-Then-Ensemble: Necessity of Top-k Union for Large Language Model Ensembling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03777","snapshot_observed_at":"2026-08-01T05:09:57.457701Z","title":"Determine- then-ensemble: Necessity of top-k union for large language model ensembling.arXiv preprint arXiv:2410.03777, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.457701Z"},"links":{"cited_paper":"/paper/2410.03777","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:bf70824c07c34d85010d89a346263554360195fde11e662b28c953e552e34178","observation_id":"f447a65a-a3e8-4bb8-a499-dce8ee665cc4","resolution":{"observed_at":"2026-08-01T05:09:57.457701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.543632Z","title":"Qwen3.5-2b.https://huggingface.co/Qwen/Qwen3.5-2B, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.543632Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:9ab41fc6fe8bcce29b04e634093752fb4608d594cb864cea8f3552c4231da6ba","observation_id":"eb76f324-2e42-4a7f-8292-0e5c48251517","resolution":{"observed_at":"2026-08-01T05:09:57.543632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-01T05:09:57.723805Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools.arXiv preprint arXiv:2406.12793, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.723805Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:70e5ba1a6514d4e92a6afedaae0d6066d113e4ff12fb19dabf8bd48af7aa4a24","observation_id":"e901e7a8-151d-4e43-b55e-687384cad144","resolution":{"observed_at":"2026-08-01T05:09:57.723805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:57.871797Z","title":"GLM-Z1-9B-0414: Model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.871797Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:18e21aa403787f99ea2ceea82e0d4adb5e7ea9feca0a95764b4380aa345a053d","observation_id":"f3e9f124-8704-4427-bcee-340c8f19b253","resolution":{"observed_at":"2026-08-01T05:09:57.871797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T05:09:57.981831Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:57.981831Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:cc9e36b2449faaf2cc1b47d5ac623dda1bcd45cf3ef2654fd83071f236446dd4","observation_id":"c1398cfc-8931-4562-a8a6-8a2d1b78acd4","resolution":{"observed_at":"2026-08-01T05:09:57.981831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-16T14:32:08.450873Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-01T05:09:58.131045Z","title":"TACO: Topics in algorithmic COde generation dataset.arXiv preprint arXiv:2312.14852, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.131045Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:895b8c90376492e1ebddde83aaf2740f93f80ff895cb95ffac19dea904969eed","observation_id":"ce7a54d4-7973-4358-91b8-0cf20ab783bf","resolution":{"observed_at":"2026-08-01T05:09:58.131045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:58.301172Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.301172Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:ab5435f5264126657c2708184db916cf837965c76a8718ec8b168778285a8820","observation_id":"ec07b375-9a8d-4024-bb0c-4d8cabad7f3f","resolution":{"observed_at":"2026-08-01T05:09:58.301172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:58.442901Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.442901Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:a7d9c77dbc3704ddf5f35b9ba5b1a3eb71084fbd0c70187299ff04c239cdb122","observation_id":"3626d464-d741-4a68-9cec-713a2f01c44d","resolution":{"observed_at":"2026-08-01T05:09:58.442901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:58.559750Z","title":"MathArena: Evaluating LLMs on uncontaminated math competitions.https://matharena.ai/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.559750Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:83b063cc6e08fdabe675d00b80ca5252cc8d3a454c7ade61887df3c3dbc3f3b8","observation_id":"0deacad6-a97a-4098-9d60-3100c1b5395f","resolution":{"observed_at":"2026-08-01T05:09:58.559750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:58.691795Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.691795Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:1ea92a73a7b905676f96e7f1e847afa1eb824bb9e8101618f9ca07547f034193","observation_id":"31d403b7-e71b-4d42-85c5-8ca99a464a83","resolution":{"observed_at":"2026-08-01T05:09:58.691795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:09:58.778304Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.778304Z"},"links":{"citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:21ed3a02f6a043530d2601a0510260caeb972f5492a052f41030aee94e9a3d22","observation_id":"2df03126-c2c6-4b6f-aab6-5f2f0fc4a179","resolution":{"observed_at":"2026-08-01T05:09:58.778304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-01T05:09:58.839779Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.839779Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:a01f5df40583201cf601c2771e18850bb40161ba76b978310eb65ad70b8031ec","observation_id":"2733ff5c-365e-48b8-ae58-246c8ada2964","resolution":{"observed_at":"2026-08-01T05:09:58.839779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T05:09:58.972025Z","title":"DeepMath-103K: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.972025Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:ad7ebd7402a4514fdeb96fcd4d88f5c244426f2815d30b0ae7cc1fbdc9d7383e","observation_id":"3b5f5768-87a2-432a-88c7-92682d12d1ef","resolution":{"observed_at":"2026-08-01T05:09:58.972025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-16T12:53:05.855883Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-01T05:09:59.059091Z","title":"Realized-path","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:59.059091Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:828e314cb893a9ff883e9589e8843dddd7bf04b49e553ab042a1adcbc36cfaa4","observation_id":"24bd331e-ab2e-4fc7-b682-51c81dd77a38","resolution":{"observed_at":"2026-08-01T05:09:59.059091Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T18:21:45.548920Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.22334."}