{"as_of":"2026-08-11T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86e909e86819b9598829b0d6034a13d478daed64669a49544ef75a649bdbc81a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:35:54.174094Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T09:52:30.187137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.020344Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"cited_work":{"arxiv_id":"2501.16937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16937","snapshot_observed_at":"2026-07-03T10:48:02.020344Z","title":"arXiv preprint arXiv:2501.16937 (2025)","venue":null,"work_id":"f78346e9-2b0a-43da-93ce-d3bdc3348e6c","year":2025},"citing_paper":{"arxiv_id":"2606.12171","last_updated":"2026-06-10T14:59:26Z","snapshot_observed_at":"2026-08-07T06:15:09.497629Z","submitted_at":"2026-06-10T14:59:26Z","title":"Beyond Dark Knowledge: Mixup-Based Distillation for Reliable Predictions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T09:52:30.187137Z"},"links":{"cited_paper":"/paper/2501.16937","citing_paper":"/paper/2606.12171"},"observation_digest":"sha256:c820f89852bb8d5ff4ae0214bf91310b0e7eb6fade7bf0de0d59bdcb2daa2bdd","observation_id":"9104b84b-58b6-4bb9-bc56-394ace32925a","resolution":{"observed_at":"2026-07-03T10:48:02.021846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16937/citation-record","integrity":"/paper/2501.16937/integrity","json":"/paper/2501.16937/citation-record.json","paper":"/paper/2501.16937"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T05:35:54.046289Z","title":"Phi-3 technical re- port: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.046289Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:633af2b0971ede0c6328b43cd3fc82f1df331467f77bd7c9db4eae0424aee48f","observation_id":"77dd83ae-1cb4-40ae-9a46-47360309da6e","resolution":{"observed_at":"2026-08-10T05:35:54.046289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.664463Z","title":"Model compression","venue":null,"work_id":"c9200fe5-edc2-4fa1-bcff-86e2aba4397d","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.058985Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:a7304da17b0b3c84f3900fd9a2ba0125a357c6c43af26652cd2ade8822971808","observation_id":"bd62dfc6-15f8-4ce2-9946-76c274a4d383","resolution":{"observed_at":"2026-08-10T05:35:54.667986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05694","last_updated":"2025-01-27T03:50:31Z","snapshot_observed_at":"2026-07-06T16:29:47.919377Z","submitted_at":"2023-10-09T13:15:23Z","title":"A Survey of Large Language Models for Healthcare: from Data, Technology, and Applications to Accountability and Ethics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05694","snapshot_observed_at":"2026-08-10T05:35:54.062748Z","title":"A survey of large language models for healthcare: from data, technology, and applications to accountability and ethics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.062748Z"},"links":{"cited_paper":"/paper/2310.05694","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:0612238a17f19c87f3272f517e9cf3f4a2ded9304d575f0148da212fb352924e","observation_id":"43f61cdd-6224-4823-a763-c53a23f4d57c","resolution":{"observed_at":"2026-08-10T05:35:54.062748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T05:35:54.070611Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.070611Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:c1ea39eaf963ddb0068785a422fefa0c126db854357b79817d1243a4c6d63a21","observation_id":"eb38db4f-4591-42b4-884c-3f39de042dad","resolution":{"observed_at":"2026-08-10T05:35:54.070611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.653664Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"861b0a4a-aa41-4de7-a4b9-8df11f9fb48a","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.074624Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:910d4fe1880764ea4a9fd5d96112f33ba5b711bc4aa353fcf6845df00b009066","observation_id":"9713d0d5-afe5-4c37-b06e-c7a1771e438d","resolution":{"observed_at":"2026-08-10T05:35:54.657616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-10T05:35:54.078249Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.078249Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:91a6e036cb1cdcfe0e0059ee379064ebca1dd4a1ae07365173220a7318925e67","observation_id":"3179876e-9302-4675-9d44-0378985d1da7","resolution":{"observed_at":"2026-08-10T05:35:54.078249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T05:35:54.086080Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.086080Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:6b5ea5a67a856f7976a26ebf0fb9389ddb68c65691fbd605ddb040ba2974d721","observation_id":"dcdd0166-75bb-421d-b8fb-c143d035449f","resolution":{"observed_at":"2026-08-10T05:35:54.086080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.643647Z","title":"github.io/blog/qwen2.5/","venue":null,"work_id":"6c168535-d061-42e1-b337-e5bde4e060b2","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.093435Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:0fece04de8bd656f7e5142c1466736d77051a92755c335e00ada9dde8f13b6b9","observation_id":"b38886da-c8a2-4a57-982a-1179fc0bdea7","resolution":{"observed_at":"2026-08-10T05:35:54.647108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16840","last_updated":"2024-02-26T18:59:03Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:59:03Z","title":"MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16840","snapshot_observed_at":"2026-08-10T05:35:54.100503Z","title":"Omkar Thawakar, Ashmal Vayani, Salman Khan, Hisham Cholakal, Rao M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.100503Z"},"links":{"cited_paper":"/paper/2402.16840","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:0de80f6ef5520da4938a0c88edef821189313de5c49a700d6f91398c473056cd","observation_id":"554e9f8e-23a0-4126-b072-a4c58c7f2538","resolution":{"observed_at":"2026-08-10T05:35:54.100503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T05:35:54.104079Z","title":"Llama 2: Open founda- tion and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.104079Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:08970cb0d9159c0ac9b84f0d24e1a60fbbd9d5f00fa2909b54e769e3e4b844b3","observation_id":"03b96d71-7cd8-49df-aa89-f9d1aca40c6c","resolution":{"observed_at":"2026-08-10T05:35:54.104079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-10T05:35:54.107705Z","title":"Efficient large language models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.107705Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:ac7c6f857a8b8c764b5a7e6d0699f97a02f7cfa61ee4b5e1b2279b691befc874","observation_id":"6ae001d9-89f7-42cf-959a-c864939fc4cc","resolution":{"observed_at":"2026-08-10T05:35:54.107705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-10T05:35:54.111452Z","title":"Bloomberggpt: A large language model for finance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.111452Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:c656d65c409c806c55d3094ef7fbf6899b7f0978efc12698eff57d14105b3fcb","observation_id":"d9de9a0a-3e57-46ab-9d63-7e2ea1b81895","resolution":{"observed_at":"2026-08-10T05:35:54.111452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02657","last_updated":"2024-12-08T13:03:38Z","snapshot_observed_at":"2026-08-08T09:33:25.935927Z","submitted_at":"2024-04-03T11:40:17Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02657","snapshot_observed_at":"2026-08-10T05:35:54.115275Z","title":"Rethinking kullback-leibler divergence in knowledge distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.115275Z"},"links":{"cited_paper":"/paper/2404.02657","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:50285eb3f41056424344a398e2923f546b29f03db342c4e01888066f40dd2135","observation_id":"2c940cc9-6d45-4362-9adf-55785a3c25be","resolution":{"observed_at":"2026-08-10T05:35:54.115275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-10T05:35:54.118912Z","title":"A survey on knowledge distillation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.118912Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:7e8e8fcf73d0083d9af5af4d446def1cf7505bd37080e5b94b3295acc82c8ad4","observation_id":"e87709ec-66be-47e2-a717-b1b91d721758","resolution":{"observed_at":"2026-08-10T05:35:54.118912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T05:35:54.122907Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.122907Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:0163dc10de3659baa7de7f1097234be18b081f8d0a6ab64a3d0d316a00eed28b","observation_id":"0552e1fd-5739-46dd-b0a7-086c38c8782f","resolution":{"observed_at":"2026-08-10T05:35:54.122907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T05:35:54.126695Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.126695Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9ca8c534840bd6b9cb62c92d04ee0386df98f0d98087298a1776925707823b9c","observation_id":"7abc8490-a37f-48ea-8e9a-50f82133dae3","resolution":{"observed_at":"2026-08-10T05:35:54.126695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06488","last_updated":"2023-04-04T06:22:09Z","snapshot_observed_at":"2026-08-10T10:39:14.036657Z","submitted_at":"2023-04-04T06:22:09Z","title":"One Small Step for Generative AI, One Giant Leap for AGI: A Complete Survey on ChatGPT in AIGC Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06488","snapshot_observed_at":"2026-08-10T05:35:54.130476Z","title":"One small step for gen- erative ai, one giant leap for agi: A complete survey on chatgpt in aigc era","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.130476Z"},"links":{"cited_paper":"/paper/2304.06488","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:c2a9797f4eda66844b267ef3fa9cf9aff878729d00906e800110437b6cce41e4","observation_id":"4b6d2d02-a0bc-471e-8004-76bc315fcfa0","resolution":{"observed_at":"2026-08-10T05:35:54.130476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.633019Z","title":null,"venue":null,"work_id":"48bc939f-551b-4a9e-b0b3-b454c2f93135","year":2020},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.134366Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9f66063b1aafe10e46cb64b9794e9a0adf76aa97becccd186d42f47ad1525ef8","observation_id":"d60dae55-6a2b-4712-8608-e42d2c15bfb9","resolution":{"observed_at":"2026-08-10T05:35:54.636806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.621234Z","title":"Thus, it is crucial to investigate when and whether the non-collapse condition ∥y∥2 > N ϵis satisfied to ensure that our hypothesis learns meaningful signals","venue":null,"work_id":"93a56bd1-c9d3-479e-938f-a288966b936d","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.138729Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:491ad7f749dc791244723e34f4c297b2d6402ca6ea745982cab12e3d185cc6f3","observation_id":"6acefaa7-d6a9-4c20-83e6-4056a95ecbd2","resolution":{"observed_at":"2026-08-10T05:35:54.625343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.610841Z","title":null,"venue":null,"work_id":"220826a5-553c-4089-8126-d14c2c0d1337","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.142307Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:8c042e61a8fc27b3e9b964973026af521dd0531719cd8f16a865894cbcec398f","observation_id":"a2e1d492-a209-4c77-a08b-7df58214a83d","resolution":{"observed_at":"2026-08-10T05:35:54.614338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.501621Z","title":"tY τ =0 1 − t − τ T # ·","venue":null,"work_id":"89af13c4-4ce1-4f38-a27f-18286b4d74a9","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.146007Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:743db2fb2ba613112ca5323f32e207d3fab8ea46f579c0febb5e6644eb893b76","observation_id":"33fe7a1f-a092-4394-8e00-9c04dd37ca67","resolution":{"observed_at":"2026-08-10T05:35:54.603514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.491045Z","title":"20 Published as a conference paper at ICLR 2025 Table 6: Performance comparison between TAID and Skew KL across different teacher sizes","venue":null,"work_id":"bf1664c8-49ca-42db-81c5-d168516683a9","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.149711Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:a4520b1cccadf8a01b15bae4203a24174174ce3564ad8723e91e71a0ab9d94d9","observation_id":"d2a1113c-8b8b-4515-b000-79bc8b0eb2b6","resolution":{"observed_at":"2026-08-10T05:35:54.494695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.480377Z","title":"By solving this quadratic inequality, we can verify the statement","venue":null,"work_id":"d22868a1-cc0d-4509-b3ce-5c053fa1658e","year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.153008Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9c7883298a362a786aa23648e925c71ffe66eaf9df7604abb7e580ba19813ecf","observation_id":"8f20a6da-1eda-4cc9-8c32-013c96c4e98f","resolution":{"observed_at":"2026-08-10T05:35:54.484307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.455045Z","title":"The final value of t (tend) was set to 1.0 for all experiments","venue":null,"work_id":"0633c656-a634-47a4-af3a-eddd0a56df96","year":2009},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.159900Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:11a69965de492a372e9559d0aae0184ef9679c4de30c3df55cb0bd57fbad2710","observation_id":"68592a3b-ac4e-40fe-9251-b27614f11dc2","resolution":{"observed_at":"2026-08-10T05:35:54.459234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.431417Z","title":"However, the gains are modest compared to state-of-the-art methods specifically designed for image classification, such as MLKD","venue":null,"work_id":"27c19930-c0ce-4931-afa2-47984a6a04a1","year":2024},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.166852Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:60eea22b0aafd0725c3a30d16dcdfb341ef9e3769a6ed027cca23d1498a2b93b","observation_id":"3a6ceb88-b7c2-4429-8b7d-4cc5be00d6c7","resolution":{"observed_at":"2026-08-10T05:35:54.435367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.420430Z","title":null,"venue":null,"work_id":"00b07477-0432-45ab-ba62-e3bc044f7909","year":2024},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.170283Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:a7b739621fe686b2957372b2758e7324896ff633436dd522dffa54e03f73f326","observation_id":"f43e7a37-1caa-4f52-beb4-eb5e6bb55b33","resolution":{"observed_at":"2026-08-10T05:35:54.424279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.406510Z","title":"This demonstrates the effectiveness of our distillation approach in creating a compact model that maintains high performance across a diverse range of language tasks","venue":null,"work_id":"4930f4ec-fbc8-4aa4-936e-b70eaad2fa32","year":2024},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.174094Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:941ab22acc3f5f515200905317fe4a8f5d32ba06404a6eba609b9631e781bfe8","observation_id":"1565bf43-f798-49cf-bd92-2761e857fbc3","resolution":{"observed_at":"2026-08-10T05:35:54.412612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.467421Z","title":"To select the best checkpoint for evaluation, we calculated the ROUGE-L score on the validation set after each epoch and chose the checkpoint with the highest score","venue":null,"work_id":"a7ae98a5-6066-439b-abea-4938943a024b","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.156525Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:b91902da60a74bcfbc4d3deb099785f1adb6844391c1443aebdd0a1f7d0a76bc","observation_id":"2b076029-d416-4e0b-9ab9-50010375728f","resolution":{"observed_at":"2026-08-10T05:35:54.471825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:35:54.442557Z","title":"The TAID-specific parameters for the pre-training experiments were kept consistent with those used in the Phi-3- mini-4k-instruct pair in the instruction tuning experiments","venue":null,"work_id":"e6bd9ed1-fd00-453f-b0ed-1a157130a545","year":2025},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":640,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.163342Z"},"links":{"citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:7c356113fc0d65248b53500c58751c410e82a52b7fc0a623f6feea603a5b61e7","observation_id":"b5f6077b-441f-44f3-8c66-9a6e75e575fa","resolution":{"observed_at":"2026-08-10T05:35:54.446872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-08-10T10:16:43.623455Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-10T05:35:54.089634Z","title":"Mobile edge intelligence for large language models: A contemporary survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.089634Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:63c00407e4b9e61c8f2c13b7c72039e7b736ebbc3b1ddfd584a8bee9647d1663","observation_id":"74c06122-bf3a-4f29-aeb9-a4945c039624","resolution":{"observed_at":"2026-08-10T05:35:54.089634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T05:35:54.096779Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.096779Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:339e4cf8b733749069b2ff8058407ea47632db23d95e085f0ca17e43ea787ec1","observation_id":"08d1517b-8726-45aa-bd62-dc397eb12060","resolution":{"observed_at":"2026-08-10T05:35:54.096779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14679","last_updated":"2024-11-04T17:36:38Z","snapshot_observed_at":"2026-08-10T16:10:18.066109Z","submitted_at":"2024-07-19T21:47:57Z","title":"Compact Language Models via Pruning and Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14679","snapshot_observed_at":"2026-08-10T05:35:54.082322Z","title":"Compact language models via pruning and knowledge distillation.arXiv preprint arXiv:2407.14679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.082322Z"},"links":{"cited_paper":"/paper/2407.14679","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:d0e33103fd5908c674325fef819ea0d7e30248d0f011b73fe66aa9232a0f7e06","observation_id":"86a62372-8650-43c0-9cd6-1b93a3e5e4e9","resolution":{"observed_at":"2026-08-10T05:35:54.082322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-10T05:35:54.066809Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.066809Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:716201bab312e13db8abe8216ce2a7a31df86a0021fe9a667dfab3705e82f1a5","observation_id":"06d5b9d5-aec3-4cb1-9fc9-ddeab0288856","resolution":{"observed_at":"2026-08-10T05:35:54.066809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-07-06T17:36:27.931373Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-10T05:35:54.050974Z","title":"Stable lm 2 1.6 b technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.050974Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9415fbd440dfc37ce073df8e7a43beeff78cab8ad1328a4deff28be7bca99a5e","observation_id":"96268f02-0d74-4659-8c50-842a38acbad4","resolution":{"observed_at":"2026-08-10T05:35:54.050974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T05:35:54.055053Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T05:35:54.055053Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.16937"},"observation_digest":"sha256:9d14e59864ccbce96d95b22daf92e3047ea447abcb01c81e75d846e005fa00e9","observation_id":"7a06972f-c593-4434-b353-f27d15e2a050","resolution":{"observed_at":"2026-08-10T05:35:54.055053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16937","last_updated":"2025-02-27T23:41:37Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T16:11:46.519970Z","submitted_at":"2025-01-28T13:31:18Z","title":"TAID: Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer in Language Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2501.16937."}