{"as_of":"2026-08-05T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:588a25105e770f140fc4c3ae4b377586eeb67ab7a8b9951ffc3d7cda38e718c7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:17:14.427529Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:20:44.486147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.03396","snapshot_observed_at":"2026-08-01T23:20:44.486147Z","title":"Towards distillation-resistant large lan- guage models: An information-theoretic perspective,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15467","last_updated":"2026-07-16T21:33:37Z","snapshot_observed_at":"2026-08-04T21:51:28.624047Z","submitted_at":"2026-07-16T21:33:37Z","title":"ADS-C: Antidistillation Sampling for Classification","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T23:20:44.486147Z"},"links":{"cited_paper":"/paper/2602.03396","citing_paper":"/paper/2607.15467"},"observation_digest":"sha256:7ab0f1de45807b48290a008037a6d940335c38c05c6d7e9e86c9a0792fbff60e","observation_id":"846a3e29-f40e-4e7f-86bf-38238ced16d9","resolution":{"observed_at":"2026-08-01T23:20:44.486147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.03396/citation-record","integrity":"/paper/2602.03396/integrity","json":"/paper/2602.03396/citation-record.json","paper":"/paper/2602.03396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Healai: A healthcare llm for effective medical documentation","venue":null,"work_id":"01876a16-1074-4a09-9288-70015930ebc2","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:63064942646821e86665a090d5389c827c7e2d8eae01b5d0916c176514c46abd","observation_id":"3419b5a4-d48f-4289-9705-9b005bb52f19","resolution":{"observed_at":"2026-05-16T08:17:36.987658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation","venue":null,"work_id":"fd311153-ee64-4e94-afcc-d2ec0a6703d5","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:d48e0d6affef1add47b2fee21d5b8d39f6a23976afd6929d274b02544b5e12fa","observation_id":"a855396b-9299-429b-9b08-2843f176b017","resolution":{"observed_at":"2026-05-16T08:17:36.981569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving factuality and reasoning in language models through multiagent debate","venue":null,"work_id":"555a9802-2c35-4fcc-8fbb-d44ab1a91e01","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:b55496cff04cdc931278c134d144557ef7ecf16ed8d7533587d3d4724e18d04f","observation_id":"0b7fe16d-8d96-45d1-9638-f8782d8710bc","resolution":{"observed_at":"2026-05-16T08:17:36.989750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:c550a48b82cc77af37b71642cc628e701ab796bb648ca07602aa80d6031e8f4d","observation_id":"6521d4e1-f20d-4541-b6df-032bc458b2a5","resolution":{"observed_at":"2026-05-16T08:17:36.150622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:32:48.641725Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":"637f74bd-e856-4ef7-8649-653feea2daf0","year":2016},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:e3424dfa5197b641a55f39cc6fe4ff89a9a4376bf6c691739a0d4acb080f9516","observation_id":"8374efb2-122d-4c41-ac5b-d5d5f678715f","resolution":{"observed_at":"2026-05-16T08:17:36.983760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"f6d88fe8-3131-40c9-acc4-fb78b12c2718","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:2d8b058598c36f54695ff074cccd79b695fd4013276f0a074a63d74c6d611fe0","observation_id":"d33c244a-f188-4567-9b53-80b16d9e7760","resolution":{"observed_at":"2026-05-16T08:17:36.985737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:33:54.359321Z","title":"A watermark for large language models","venue":null,"work_id":"aa835a4f-6157-4bcc-a128-fe39d56e71d7","year":2023},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:1c65537cf1c71a1509a7d85acf3b4c3766440f616651887d360fd0f36da0777c","observation_id":"61dad3d2-c860-45ba-b42e-58fcc25576c2","resolution":{"observed_at":"2026-05-16T08:17:36.992401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Securing large language models: A survey of watermarking and fingerprinting techniques.ACM Computing Surveys","venue":null,"work_id":"d3fea31b-8f18-43c3-8ca2-c3ae758b4f5f","year":2025},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:c3a2a70e410fee94a95974b719a8a1d67b18f4c81c0a0fd187b91dea3e633aa7","observation_id":"568777eb-7ba8-4c1d-acea-4a2cb8186363","resolution":{"observed_at":"2026-05-16T08:17:36.979610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Watermarking techniques for large language models: A survey.Artificial Intelligence Review","venue":null,"work_id":"9f5ed3c3-142d-4918-bf12-a109a9a904e6","year":2026},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:9ffd97e50a9c4d3d1d597c14699f7de49f174440c6edf9b5680f935847ea4c9a","observation_id":"05507da6-a829-4af9-9506-602a09490ac6","resolution":{"observed_at":"2026-05-16T08:17:36.901960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D-dae: Defense-penetrating model extraction attacks","venue":null,"work_id":"673efd32-3001-49ac-8e9f-20d58055c447","year":2023},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:7310b37702bcc571ff1d4a04ee8d6b80baa240454ddce00a3367d6265aa48e07","observation_id":"b9d5f715-5ae8-478f-87e9-c99ab73d5218","resolution":{"observed_at":"2026-05-16T08:17:36.913072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial fingerprinting for generative models: Rooting deepfake attribution in training data","venue":null,"work_id":"cdd4dbee-c1f3-478a-8aa4-7ddfba17a438","year":2021},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:9d7ba1cf07f7423c7abf36d0be7bf770a7f6bea39f82027b1cb99b0224266c13","observation_id":"8992a952-b3bb-476f-a1c1-07a9998ad8f0","resolution":{"observed_at":"2026-05-16T08:17:36.919106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fingerprinting deep neural networks globally via universal adversarial perturbations","venue":null,"work_id":"a2d51bfd-0e7c-4190-9b70-83f931223f1d","year":2022},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:b2adcfb9cdbd853c62b2662fe90c7b10ef0a2c63f2275e7c4efb0bd3fa50493c","observation_id":"d9bb8127-65ab-48f5-854f-f0e73a3c8b33","resolution":{"observed_at":"2026-05-16T08:17:36.955311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Antidistillation sampling","venue":null,"work_id":"d8f31deb-3dc0-4c6b-b86f-52ebea489262","year":2025},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:e9366cf38d2214f3619e8dae2fcc68038c7c216262f90423fe38a6995f78674d","observation_id":"9f3b2e77-2946-4cb5-bf42-349cc32f8715","resolution":{"observed_at":"2026-05-16T08:17:36.147768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:17:41.339177Z","title":"DOGe: Defensive output generation for LLM protection against knowledge distillation","venue":null,"work_id":"e09e64b5-d57d-4ac7-8b75-629206c39281","year":2026},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:3f6179405c2962690435cdc606f7c5d193ec8ad5cfb11138145c35653ac0b524","observation_id":"c6c331c8-e42c-4ec4-9862-5ae242891cb8","resolution":{"observed_at":"2026-05-16T08:17:36.128324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphanet: Improved training of supernets with alpha-divergence","venue":null,"work_id":"33e75f0e-d8ed-4614-89a6-d7753f499a83","year":2021},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:5a5209099218ea174fd899ff1aafddcaa22df997fc654963d025e83e1888585b","observation_id":"9d0fa617-4e8c-40f7-8074-79d77a15f845","resolution":{"observed_at":"2026-05-16T08:17:36.952431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abkd: Pursuing a proper allocation of the probability mass in knowledge distillation via α-β-divergence","venue":null,"work_id":"450a5244-384e-4635-9192-7732fe8b7a34","year":2025},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:1565f3594638a24f61df4bb5576b52dd07da08f6768de1194abda4b71aec4f8d","observation_id":"a55f49b4-964a-4884-b635-857570d48ac9","resolution":{"observed_at":"2026-05-16T08:17:36.973251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayes conditional distribution estimation for knowledge distillation based on conditional mutual information","venue":null,"work_id":"218e3126-45c2-4e79-af94-80a52b621266","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:daea470d3ad5fc5582afd54a7950c14c7f613da106cd6a1d40f636f5eafc2e7b","observation_id":"143771c4-1a7d-47a5-8cec-0afcf6fc6ff4","resolution":{"observed_at":"2026-05-16T08:17:36.965066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opening the black box of deep neural networks via information","venue":null,"work_id":"4f2babc9-3732-48da-b49f-c462f8bdbb9a","year":2017},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:1028e5d764a46d3dd932ee3e737225f8f443c77bc309701e408ed61eb6e122ef","observation_id":"3d06801b-9ad3-4b1a-8ef6-3213aef20c5a","resolution":{"observed_at":"2026-05-16T08:17:36.967500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructional fingerprinting of large language models","venue":null,"work_id":"3e571146-2651-44cb-b508-4f4dbfde4e6c","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:bdee126f7b1f13b2197fc41bd41958c3c0b11c970ed5ded2c422c27b5ced872b","observation_id":"6f5824aa-fcee-41d3-a0b2-55bb9445fa1e","resolution":{"observed_at":"2026-05-16T08:17:36.960434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The information bottleneck method.ArXiv","venue":null,"work_id":"34594477-c017-4b38-b3ab-eb51e3d650ee","year":2000},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:4f1f9403686dbd0f37022b1568a6f984f71c47457a9caedfd46cb1baa4ca6f65","observation_id":"3f530dbd-9d23-48c7-8afc-1a782d17c7a3","resolution":{"observed_at":"2026-05-16T08:17:36.971118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning and the information bottleneck principle.Information Theory Workshop (ITW)","venue":null,"work_id":"b85311a5-bf9b-460e-99eb-e201870d8b09","year":2015},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:736475eafc40b971e5d6953f29a52335f0d6f31deff20f64aee554b294cef0ae","observation_id":"ab3a6840-f041-4658-a2a8-68118c23db61","resolution":{"observed_at":"2026-05-16T08:17:36.963019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alemi, Ian Fischer, and Joshua V","venue":null,"work_id":"56e05a96-ac72-430b-b53a-703378058521","year":2017},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:4ef3da4bde51eb9ce45360b851a296379f28d99d5cc390c193d316d64ea77f74","observation_id":"38753cc1-ddd9-440f-bd40-ec429619bf83","resolution":{"observed_at":"2026-05-16T08:17:36.975233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:52.650423Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3","venue":null,"work_id":"421353f1-f10a-4559-8de6-966e7d699eaf","year":2022},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:3f2d1bfa596397cb93a9bf83fef1eacea8564da22fd479cad9f32f7b7096ec2e","observation_id":"767134fe-ea7a-4ec7-a175-954af281dbfa","resolution":{"observed_at":"2026-05-16T08:17:36.977620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:5ecd289a1f9d614c15d147094d5f6e9966895014dbd15c87affb71fd65acf554","observation_id":"deb549e6-7604-4a3e-a9bc-5252fe603b39","resolution":{"observed_at":"2026-05-16T08:17:36.144549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:345c9a3766a8a75f1152a63afa3595f00294ff4a6e61bab904fa166c27641e0f","observation_id":"c1773afd-538c-4038-bc84-e7f4c7641c91","resolution":{"observed_at":"2026-05-16T08:17:36.124632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:0dd45dedbb35df754f712561bf2948d51c59531a41abd135a91226bd472c6579","observation_id":"eb9c7c1f-621d-44fb-8dc7-0f8cec4dbda8","resolution":{"observed_at":"2026-05-16T08:17:36.141356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:11a7f2f8127045f9cdd68a6cedb0ef7c72dec735de546386a40b16747c629aea","observation_id":"5c17180a-5d1e-41ac-af0e-d0c1a35cf361","resolution":{"observed_at":"2026-05-16T08:17:36.131618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:219f1384171b0cb02c4de9de69d71b59f3e3f4e0b8c74802a0cf7ef4823bd222","observation_id":"91842926-54fd-4b3f-af9d-624ae1a65822","resolution":{"observed_at":"2026-05-16T08:17:36.134645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.12067","doi":"10.48550/arxiv.2502.12067","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067","venue":"ArXiv.org","work_id":"3ef0bd59-5ccb-4785-82a0-6c2ad863a0c1","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:d57e4f04416107e300814c60e82c49c7f70011ba989ca94dd000b277efe5ea89","observation_id":"195e1844-860d-45cd-b328-d02d01a5396e","resolution":{"observed_at":"2026-05-16T08:17:36.138077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:32:39.114869Z","title":"Let’s verify step by step","venue":null,"work_id":"7c9f7d5c-e081-4728-8d71-07bae6642366","year":2023},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:afd11e995fb5f3d006f7f4ab2e3dd75c2a16cbeb701a84d9afa37774345f0785","observation_id":"8dc2d01d-ac45-4a5b-9bac-3585bed3c448","resolution":{"observed_at":"2026-05-16T08:17:36.941620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"cc4b420e-469e-4647-bb5f-e7d6375cafdf","year":2024},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:8d373633b0570d0e7cb018a3fcf22cf3b5d217d196457ccce54ab194131bc372","observation_id":"31e26d52-6e65-468d-9323-92b625676b0e","resolution":{"observed_at":"2026-05-16T08:17:36.933222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"35a7e1cb-3099-43d2-ade3-7a840169ad68","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:c53189b3ee301f0a44172b5f529c45430605c327d92a2ed468ab07b97785acdf","observation_id":"dce361bb-10c8-4079-912b-2dbb99200243","resolution":{"observed_at":"2026-05-16T08:17:36.936123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Don’t repeat the question","venue":null,"work_id":"dfcfb893-010e-4098-9cba-d65831ea5543","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:32280fc79db457ea07951a016dfe7f28ee8c629245c967843544ab94ca23a1e4","observation_id":"a9fe66d5-b618-4c8c-86e7-c2deec3248d9","resolution":{"observed_at":"2026-05-16T08:17:36.930127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"using someone as a mere means","venue":null,"work_id":"a949f72b-c4f6-44ea-b6c8-b6cb70dbabd3","year":2048},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:dd0f38a6524623e2496ce3aa8d7f5d4f2df15a33a3bcf3d0f8cb56a763d3897f","observation_id":"8daba266-f631-46d2-82f5-7261c22a20a9","resolution":{"observed_at":"2026-05-16T08:17:36.916137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"964a8319-35cf-45ab-aead-9e3fcca90466","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:073d4908334178fe8f11615b735e1d69a14f6ecacda506462088a9d3683f6bce","observation_id":"e0f04018-86d9-442c-b1b4-5f1b1d9972af","resolution":{"observed_at":"2026-05-16T08:17:36.945499Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"92f215fb-dfd1-41b0-93d8-cd01e7765532","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:eef099a51e65031f1d768c9ac2e5a27545bb28d7af3359a035759091f6db6cd8","observation_id":"624cd70f-17c7-4660-b9c3-2abcc78b1d2a","resolution":{"observed_at":"2026-05-16T08:17:36.957893Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a217bd1-50b7-4ec9-9d37-fe3a8acc8c20","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:f49ba11364e9cde487298dd174341a7f0d643b951097dee18627996009831db4","observation_id":"a3860dbe-0d6e-4877-9791-05d336670110","resolution":{"observed_at":"2026-05-16T08:17:36.921874Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6afb5c4e-e752-4d90-b84f-c8bc3b56697c","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:3479fb39307635b875abb6585646acd32022751daa871fd923ee61ffc8a47736","observation_id":"1aea6491-ff73-4223-bcf1-908f4112cb54","resolution":{"observed_at":"2026-05-16T08:17:36.926148Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a4962ae-00f4-49f8-a019-6881d16ceb81","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:49a886a2a2992f5fa19aea514a8aa2cdd146d55f81e874bd509bd0c768455f33","observation_id":"c915ea52-b6eb-4d6a-80d0-f7703c91c524","resolution":{"observed_at":"2026-05-16T08:17:36.948729Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e3ae137-e8df-4f94-9370-e95854b05482","year":null},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:0cdeafd5f164b15498579d0c855aaf5894b508e23e3b27f194cedf7e0fe6fca2","observation_id":"63d0dc74-08b4-4d6c-8819-647a5e312a4d","resolution":{"observed_at":"2026-05-16T08:17:36.906148Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"29c1642c-5787-4ccc-9dd3-91c92da2cc4e","year":2002},"citing_paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:14.427529Z"},"links":{"citing_paper":"/paper/2602.03396"},"observation_digest":"sha256:9d4da0c4a888a0707788619aa65b29f277ed3d3d7421c395feef27d2176d14dd","observation_id":"48e36357-5cc0-48b4-8e10-0fd7c935230c","resolution":{"observed_at":"2026-05-16T08:17:36.909470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.03396","last_updated":"2026-05-06T12:26:57Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:16:59Z","title":"Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":6,"unresolved":2,"verified_exact":9,"verified_fuzzy":24},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2602.03396."}