{"as_of":"2026-08-10T01:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a733714c7dce41dc4ef7a8d432873839502eb031a91250b12fa32eb59c285d9d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:57:25.814259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T21:17:35.850483Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T12:26:58.015594Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/1909.11942"},"observation_digest":"sha256:cf5d890745689541c9743349ccb281af1d9054d2c8a9669d2c8fa2089c54882e","observation_id":"b50a58fd-6a2e-4d9d-b589-059f7575d5b6","resolution":{"observed_at":"2026-05-13T12:26:58.120212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2101.02388","last_updated":"2021-01-07T06:12:28Z","snapshot_observed_at":"2026-07-06T10:30:38.112588Z","submitted_at":"2021-01-07T06:12:28Z","title":"Knowledge Distillation in Iterative Generative Models for Improved Sampling Speed","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T03:56:19.837017Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2101.02388"},"observation_digest":"sha256:f7e29819f5bc969c5c8a766c8183343e2f173cf601b3a1d7e7651a778bc40baa","observation_id":"a64d7f3e-7630-4f18-9fc8-1525884bf3e0","resolution":{"observed_at":"2026-05-17T03:56:19.902215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-09T17:57:25.814259Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.00745","last_updated":"2025-02-02T10:35:19Z","snapshot_observed_at":"2026-08-09T20:46:50.002345Z","submitted_at":"2025-02-02T10:35:19Z","title":"BEEM: Boosting Performance of Early Exit DNNs using Multi-Exit Classifiers as Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T17:57:25.814259Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2502.00745"},"observation_digest":"sha256:3b4d735b790be7f98083db6868d39ac5bcbf774ca329884418f4ce29b2fd48be","observation_id":"53667ac5-4a18-447c-846b-fd3c0643f1c1","resolution":{"observed_at":"2026-08-09T17:57:25.814259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-09T12:26:25.131696Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02372","last_updated":"2025-02-04T14:52:34Z","snapshot_observed_at":"2026-08-09T12:20:40.666949Z","submitted_at":"2025-02-04T14:52:34Z","title":"MaintaAvatar: A Maintainable Avatar Based on Neural Radiance Fields by Continual Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T12:26:25.131696Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2502.02372"},"observation_digest":"sha256:547621fa86684be68e903de9bb44651ffa4d3b1babc90a53f6af6390b4a237ce","observation_id":"1dc69456-7829-440e-b0f6-71fb2c3370e2","resolution":{"observed_at":"2026-08-09T12:26:25.131696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-08T12:50:14.725290Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T12:51:16.416704Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.725290Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:4e278c8835d09c323378f3b98478081b4ea41c58adbe620daa012fa5d8096721","observation_id":"3a7de572-72d7-4a51-80b2-fa93d0779bc4","resolution":{"observed_at":"2026-08-08T12:50:14.725290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-07T05:19:39.455568Z","title":"Patient knowledge distillation for bert model compression, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08436","last_updated":"2025-06-10T04:19:38Z","snapshot_observed_at":"2026-08-09T09:54:36.095275Z","submitted_at":"2025-06-10T04:19:38Z","title":"Olica: Efficient Structured Pruning of Large Language Models without Retraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:39.455568Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2506.08436"},"observation_digest":"sha256:8d9a1f9bdf7392ea70c2f82fc416ca9978898cf0dfd7e02c4086c60744ed0b6e","observation_id":"9ba242ea-e607-45c4-8656-c21c32ea2bf0","resolution":{"observed_at":"2026-08-07T05:19:39.455568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-07T00:13:34.333057Z","title":"Patient knowledge distillation for bert model compression.arXiv preprint arXiv:1908.09355, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.14728","last_updated":"2025-06-17T17:08:32Z","snapshot_observed_at":"2026-08-07T14:16:24.457276Z","submitted_at":"2025-06-17T17:08:32Z","title":"AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.333057Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2506.14728"},"observation_digest":"sha256:f8ca0a771b7dd646771ede1a7aad998db1e19c2ac730cba5661d5a92c7b59b4d","observation_id":"9b38405d-135d-4eb8-af14-40f04c586881","resolution":{"observed_at":"2026-08-07T00:13:34.333057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-06T23:57:25.971549Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:25.971549Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:37ae1abeedbc1e3dc82e286062ffdb52142c70813e2c4fbcecc6256c4e539253","observation_id":"6672605b-9dc7-43f7-83da-6d37ccf146d8","resolution":{"observed_at":"2026-08-06T23:57:25.971549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-06T20:46:22.171701Z","title":"Patient knowledge distillation for bert model compression.arXiv preprint arXiv:1908.09355, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.01887","last_updated":"2025-07-02T16:57:01Z","snapshot_observed_at":"2026-08-09T05:10:28.392368Z","submitted_at":"2025-07-02T16:57:01Z","title":"MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:22.171701Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2507.01887"},"observation_digest":"sha256:266bca76ee7afebb5d3be9b07d039378767943c3a7afd532832477cd9b749306","observation_id":"6ad1efc8-5f6b-46c8-a46a-d5854f7f1441","resolution":{"observed_at":"2026-08-06T20:46:22.171701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-06T13:22:47.217308Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20749","last_updated":"2025-07-28T11:57:52Z","snapshot_observed_at":"2026-08-08T16:13:24.324121Z","submitted_at":"2025-07-28T11:57:52Z","title":"Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:22:47.217308Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2507.20749"},"observation_digest":"sha256:3f6ff77a7bffa5e4d32c693064528f36289e12e0f005ba06cb4efa49fe5c8739","observation_id":"427cc078-087e-4d6b-a1d0-186875127e40","resolution":{"observed_at":"2026-08-06T13:22:47.217308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2508.03949","last_updated":"2026-04-14T17:16:30Z","snapshot_observed_at":"2026-08-04T01:34:07.529496Z","submitted_at":"2025-08-05T22:32:32Z","title":"Model Compression vs. Adversarial Robustness: An Empirical Study on Language Models for Code","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T00:01:42.228190Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2508.03949"},"observation_digest":"sha256:f22ff806a9ccce5933a97617326936768302452c9125f7e1765f6f7ec59fc777","observation_id":"da3e02a0-b92f-4709-a7c2-6d2542017fcf","resolution":{"observed_at":"2026-05-19T00:01:55.914497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-05T13:12:14.557846Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2509.00914","last_updated":"2025-08-31T15:57:13Z","snapshot_observed_at":"2026-08-09T09:56:48.034006Z","submitted_at":"2025-08-31T15:57:13Z","title":"TinyMusician: On-Device Music Generation with Knowledge Distillation and Mixed Precision Quantization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:12:14.557846Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2509.00914"},"observation_digest":"sha256:821b9fdf4cc637df594ccdbc352b1f48481db16543428aa1dd733068656161ae","observation_id":"b9e07d11-0b8e-46a7-b308-b60e3ba51776","resolution":{"observed_at":"2026-08-05T13:12:14.557846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2511.05476","last_updated":"2026-05-11T16:45:40Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T18:38:54Z","title":"A Metamorphic Testing Perspective on Knowledge Distillation for Language Models of Code: Does the Student Deeply Mimic the Teacher?","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T23:45:54.490984Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2511.05476"},"observation_digest":"sha256:b1f2d9b096eba3dac0e625b6a9e9197bc9d75e869eee589e68e5c4a08507f565","observation_id":"59a2f1f3-0e4b-414a-9f2c-7b1e7f9e0058","resolution":{"observed_at":"2026-05-17T23:50:31.924965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2604.24380","last_updated":"2026-04-27T12:10:44Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:10:44Z","title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:38.100037Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2604.24380"},"observation_digest":"sha256:ceeb18b7e1753529cc106c999fe3a24d95f9af3d8f27bfdad28f0d9bbb9b548e","observation_id":"49097048-3337-4c14-a86f-4948f7eaf24e","resolution":{"observed_at":"2026-05-11T21:56:14.132583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:898e8d033f99381b0522e771a59c70f6ef80a676abd3ec5ec4a703ed870ff83e","observation_id":"44dd3aee-e895-49b9-a19f-10385be2c025","resolution":{"observed_at":"2026-05-11T15:46:42.823215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2605.11260","last_updated":"2026-05-11T21:37:20Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T21:37:20Z","title":"Curriculum Learning-Guided Progressive Distillation in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:53:21.920498Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.11260"},"observation_digest":"sha256:d60c47b02a20db3b1bd235389b21b929d4c49135d685484595ae4fd6b5a89d4e","observation_id":"bf0a0a9f-1388-4073-81df-6711eb51fc0f","resolution":{"observed_at":"2026-05-13T01:57:05.779234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-30T12:23:42.587689Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:ca455ffc996153b7a438c8bbd96b0181db7fc10b1721e495b0c6ccde652dcb2b","observation_id":"1a3b452b-9c5c-4503-8765-bffb1dc09500","resolution":{"observed_at":"2026-06-30T12:24:39.185969Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-04T00:38:33.708836Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:536781b3a57d5c792ea5b8e38d34e0cb68112b243351c34efae0c70513ff61d6","observation_id":"53bb5af7-8338-4776-b903-b170b661013b","resolution":{"observed_at":"2026-07-04T00:39:16.229372Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Investigating prior knowledge for challenging chinese machine reading com- prehension.Transactions of the Association for Compu- tational Linguistics, 8:141–155, 2020a","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d3f82926589551cb459855ddcb03184bfe0cd7ea43d69296553d0657c394d3c8","observation_id":"d7be940a-e20c-4407-add2-74746e405e6a","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2606.09881","last_updated":"2026-06-03T05:44:29Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T05:44:29Z","title":"Toward Calibrated, Fair, and accurate Deepfake Detection","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T07:05:18.026601Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2606.09881"},"observation_digest":"sha256:f14be9118f27ee084521e67941f410432498566d596fad8b9f509eb4e2762157","observation_id":"c050cf69-5935-4071-9ffd-fdf07422f14b","resolution":{"observed_at":"2026-06-28T07:11:45.307920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2606.24747","last_updated":"2026-06-23T16:09:57Z","snapshot_observed_at":"2026-08-06T12:17:42.334377Z","submitted_at":"2026-06-23T16:09:57Z","title":"Scaling Laws for Task-Specific LLM Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:49.787477Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2606.24747"},"observation_digest":"sha256:4c7e97dc4c7af829f006cd921f84126e1d46d2444520d09e0a25d10a64b2cf68","observation_id":"da0caf49-bae3-492c-aa3f-4097e546ee0b","resolution":{"observed_at":"2026-07-04T17:40:00.673237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-12T05:47:14.970921Z","title":"Patient knowledge distillation for BERT model compression.arXiv preprint arXiv:1908.09355, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.02966","last_updated":"2026-07-09T05:23:35Z","snapshot_observed_at":"2026-08-07T19:24:22.261816Z","submitted_at":"2026-07-03T05:17:48Z","title":"Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T05:47:14.970921Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2607.02966"},"observation_digest":"sha256:2ce2ea304bc78f9297e6e5404d86b2f67818828eb0e53a00e6a53d3417decaf9","observation_id":"f6820243-934d-4162-b0aa-614faeb69a46","resolution":{"observed_at":"2026-07-12T05:47:14.970921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":"1908.09355","doi":"10.48550/arxiv.1908.09355","metadata_source":"pith","pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-07-10T21:17:35.850483Z","title":"arXiv preprint arXiv:1908.09355 (2019)","venue":"cs.CL","work_id":"15b142b1-fae1-4e20-b8d4-3af74cb8825a","year":2019},"citing_paper":{"arxiv_id":"2607.06796","last_updated":"2026-07-07T20:51:22Z","snapshot_observed_at":"2026-08-07T01:01:26.500725Z","submitted_at":"2026-07-07T20:51:22Z","title":"Enhancing deep learning models for time series classification via knowledge distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T21:09:54.557270Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2607.06796"},"observation_digest":"sha256:cc24540aa5d83957b4b965f7b737effc216688e87ad3104eb4987e3faf8592d9","observation_id":"55f7a977-46e9-4096-a08e-95778e262110","resolution":{"observed_at":"2026-07-10T21:17:35.864696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-04T00:41:43.093855Z","title":"Patient knowledge distillation for bert model compression,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-07T14:16:27.480135Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.093855Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:e3844a4e32bef03d9aa1e435d339c5b1fae4b9098147169433f1da313afc2b0d","observation_id":"fd44600d-a514-43ac-ab1d-bc1b4840391a","resolution":{"observed_at":"2026-08-04T00:41:43.093855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-06T05:20:01.478142Z","title":"and Liu, J., 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05104","last_updated":"2026-08-05T17:42:33Z","snapshot_observed_at":"2026-08-08T23:14:00.976836Z","submitted_at":"2026-08-05T17:42:33Z","title":"BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:20:01.478142Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2608.05104"},"observation_digest":"sha256:62c9e7b741fcd30d88e8327c7076f26cbdb7f32f417acce36a5cab615cdc228e","observation_id":"7326ea17-1aee-4884-8c93-faf489794710","resolution":{"observed_at":"2026-08-06T05:20:01.478142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.09355/citation-record","integrity":"/paper/1908.09355/integrity","json":"/paper/1908.09355/citation-record.json","paper":"/paper/1908.09355"},"outbound":[],"paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:1908.09355."}