{"as_of":"2026-08-12T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8d6a7d67eb4df1f764ee3f5e509756201cd8f4c7d4b56e80321aa9ce1eba4fa","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:52:37.270748Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:04:31.647548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:56:47.730179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-08-07T06:04:31.647548Z","title":"Knowledge injection via prompt distillation.arXiv preprint arXiv:2412.14964, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-10T09:21:59.278086Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:31.647548Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:fabb0d3102cb97b856c4ecbe3965c5605b64fd94d4bcb338f0630953c4bb531d","observation_id":"f90dd867-10d9-4bb4-b121-883f62cffc77","resolution":{"observed_at":"2026-08-07T06:04:31.647548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-11T09:47:09.096143Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T17:00:49.448352Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2605.03677"},"observation_digest":"sha256:e148f432110f593f0b2bc73d4542670297b24b2dafdaed8622d370525dbd0d4e","observation_id":"e20039dd-2798-4308-8d3c-9870e2fd9dc7","resolution":{"observed_at":"2026-05-11T23:26:16.201002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2605.18226","last_updated":"2026-05-18T11:12:45Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:12:45Z","title":"Context Memorization for Efficient Long Context Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:39:09.720412Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2605.18226"},"observation_digest":"sha256:c255caa3ad5c847fb2e52aa3bfa0d63e1b686331c8a67b234bd576006e64603a","observation_id":"fa696f57-f44a-4620-86a8-feb61f88b25c","resolution":{"observed_at":"2026-05-20T10:43:12.658948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.03979","last_updated":"2026-07-10T17:52:03Z","snapshot_observed_at":"2026-07-15T23:18:25.559225Z","submitted_at":"2026-06-02T17:56:55Z","title":"Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T10:56:13.058872Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.03979"},"observation_digest":"sha256:69e68b9d45a6aa580efc7a5056b1168137804a843e1365cbb1bbcd8bf138032a","observation_id":"30f0f7d0-80a4-4a18-96fd-14e643e083d5","resolution":{"observed_at":"2026-07-02T02:26:26.803207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-13T07:44:25.325808Z","title":"Knowledge injection via prompt distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03979","last_updated":"2026-07-10T17:52:03Z","snapshot_observed_at":"2026-07-15T23:18:25.559225Z","submitted_at":"2026-06-02T17:56:55Z","title":"Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-13T07:44:25.325808Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.03979"},"observation_digest":"sha256:dbd4ed40be47413d21582eef6a46f247c8a277c21ac5f2329b6d7ee8356f4bbb","observation_id":"9db19840-b7a8-45e5-9367-6f811e4c40c4","resolution":{"observed_at":"2026-07-13T07:44:25.325808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.04703","last_updated":"2026-06-03T10:30:09Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:30:09Z","title":"Rethinking Continual Experience Internalization for Self-Evolving LLM Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T06:29:11.398007Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.04703"},"observation_digest":"sha256:542135cc1dc5a40474c0f7c4da15306e2c789a35ff73f8c70e28a3de925ffb8b","observation_id":"2cbc327f-02d1-47a7-90a5-93bd6eb5c31b","resolution":{"observed_at":"2026-07-02T07:56:47.731556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.32002","last_updated":"2026-06-30T17:35:14Z","snapshot_observed_at":"2026-08-02T13:47:40.317163Z","submitted_at":"2026-06-30T17:35:14Z","title":"Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:58.441326Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.32002"},"observation_digest":"sha256:faf9c20b2bdc8c119a2904fd8d453b965b4979ea539b71a986fb0b66eec8aa9c","observation_id":"0d92bd82-ed75-4d1e-914f-a3c13bc959a5","resolution":{"observed_at":"2026-07-01T10:45:42.802808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14964/citation-record","integrity":"/paper/2412.14964/integrity","json":"/paper/2412.14964/citation-record.json","paper":"/paper/2412.14964"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:52:37.086452Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.086452Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c513960de962bca62ac854aa7a009e371eea90d0713307964199ddcc3580d14f","observation_id":"03e56360-c8f8-4595-8e27-5336625d58f7","resolution":{"observed_at":"2026-08-11T11:52:37.086452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14788","last_updated":"2023-11-04T04:09:43Z","snapshot_observed_at":"2026-08-02T20:54:41.815973Z","submitted_at":"2023-05-24T06:42:44Z","title":"Adapting Language Models to Compress Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14788","snapshot_observed_at":"2026-08-11T11:52:37.104311Z","title":"Adapting language models to compress contexts.arXiv preprint arXiv:2305.14788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.104311Z"},"links":{"cited_paper":"/paper/2305.14788","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:b85ae96475eade30a6a87fedf38f01f4727807472965973b1b391cb0b6274e93","observation_id":"47d91a7d-ffe6-4e50-8395-36040de64166","resolution":{"observed_at":"2026-08-11T11:52:37.104311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:52:37.112713Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.112713Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:78d43e797c8a163f8fca88a1616acfb51f3077492572b99e168da07e7dfdb04e","observation_id":"56089bf7-56f8-46e6-a1b0-93035819f9a5","resolution":{"observed_at":"2026-08-11T11:52:37.112713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-09T05:57:33.635614Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-08-11T11:52:37.116782Z","title":"The false promise of imitating proprietary llms.arXiv preprint arXiv:2305.15717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.116782Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5c43b9c8a304b281d9728f9db65f52d5e91d23303d552e565707be0d65b8c7af","observation_id":"7470d0fb-9905-4fb6-9e1e-93189fe3665b","resolution":{"observed_at":"2026-08-11T11:52:37.116782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10964","last_updated":"2020-05-05T22:00:44Z","snapshot_observed_at":"2026-08-02T02:53:18.136026Z","submitted_at":"2020-04-23T04:21:19Z","title":"Don't Stop Pretraining: Adapt Language Models to Domains and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10964","snapshot_observed_at":"2026-08-11T11:52:37.125237Z","title":"Don’t stop pretraining: Adapt language models to domains and tasks.arXiv preprint arXiv:2004.10964,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.125237Z"},"links":{"cited_paper":"/paper/2004.10964","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:3278c833cece90e6844e70e02f674131e935d5dc16392da58673ab3e78e8c72b","observation_id":"7796b37f-3803-4045-92a5-8329e84c5a90","resolution":{"observed_at":"2026-08-11T11:52:37.125237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T11:52:37.134081Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.134081Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:fc9e3231eaff91fe19760d22aee10ba41070f96538b86a02c0813ec58420f862","observation_id":"9578ef48-9612-46c7-8956-972139b897bf","resolution":{"observed_at":"2026-08-11T11:52:37.134081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07922","last_updated":"2024-08-19T05:46:56Z","snapshot_observed_at":"2026-07-06T16:06:30.884141Z","submitted_at":"2023-08-15T17:59:18Z","title":"RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07922","snapshot_observed_at":"2026-08-11T11:52:37.143760Z","title":"Raven: In-context learning with retrieval augmented encoder-decoder language models.arXiv preprint arXiv:2308.07922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.143760Z"},"links":{"cited_paper":"/paper/2308.07922","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:9235c01b965d792c6c60d9a52e1bf56ca977a4c41062e1d67bba0738bf758c60","observation_id":"6126f122-a95f-4b8c-982d-f151609a3ea6","resolution":{"observed_at":"2026-08-11T11:52:37.143760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01282","last_updated":"2021-02-03T09:18:34Z","snapshot_observed_at":"2026-08-03T22:53:08.799163Z","submitted_at":"2020-07-02T17:44:57Z","title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01282","snapshot_observed_at":"2026-08-11T11:52:37.148846Z","title":"Leveraging passage retrieval with generative models for open domain question answering.arXiv preprint arXiv:2007.01282,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.148846Z"},"links":{"cited_paper":"/paper/2007.01282","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:7248850748aaaef77da6404f286ffe0fa97f36a54ed1956c3b5c2522070d5fc9","observation_id":"2d269c3c-e99d-432c-9a0b-87bbf3a0aaa8","resolution":{"observed_at":"2026-08-11T11:52:37.148846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-08-11T18:41:06.096345Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-08-11T11:52:37.153376Z","title":"Generalization through memorization: Nearest neighbor language models.arXiv preprint arXiv:1911.00172,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.153376Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:547a0f13ebcda1657842d7c7147083370b46897f80c21a9684011f80ce8c4bd6","observation_id":"805153a0-8015-4b22-91e7-c5dee28c07b2","resolution":{"observed_at":"2026-08-11T11:52:37.153376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01352","last_updated":"2024-05-06T07:50:35Z","snapshot_observed_at":"2026-08-10T12:05:58.040897Z","submitted_at":"2023-10-02T17:16:26Z","title":"RA-DIT: Retrieval-Augmented Dual Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01352","snapshot_observed_at":"2026-08-11T11:52:37.162226Z","title":"Ra-dit: Retrieval-augmented dual instruction tuning.arXiv preprint arXiv:2310.01352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.162226Z"},"links":{"cited_paper":"/paper/2310.01352","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:90e7ba78c963d50b4e6e8a29af27d93c02bbe581eaf866375d7280778b98f792","observation_id":"763a6aab-fa9c-41fb-ac48-d46c6e206bb6","resolution":{"observed_at":"2026-08-11T11:52:37.162226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16724","last_updated":"2025-02-16T19:35:11Z","snapshot_observed_at":"2026-07-06T18:50:52.800619Z","submitted_at":"2024-07-23T12:38:48Z","title":"Structure-aware Domain Knowledge Injection for Large Language Models","version":3},"cited_work":{"arxiv_id":"2407.16724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.16724","snapshot_observed_at":"2026-08-11T11:52:37.515491Z","title":"Structure-aware Domain Knowledge Injection for Large Language Models","venue":"cs.CL","work_id":"677b5a5f-9238-4378-baac-89089549d7d5","year":2024},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.167306Z"},"links":{"cited_paper":"/paper/2407.16724","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:df5f5aadb52a8b196475d76981c8ea44ea53bc802d0c2ada663da1bdb78c5328","observation_id":"e457e219-f634-44d5-a729-f0ae9a5cce2f","resolution":{"observed_at":"2026-08-11T11:52:37.522227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10225","last_updated":"2024-10-30T02:58:14Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:59:11Z","title":"ChatQA: Surpassing GPT-4 on Conversational QA and RAG","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10225","snapshot_observed_at":"2026-08-11T11:52:37.171818Z","title":"Chatqa: Surpassing gpt-4 on conversational qa and rag.arXiv preprint arXiv:2401.10225, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.171818Z"},"links":{"cited_paper":"/paper/2401.10225","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:9d0637e647b8fbcb50d573f9de00773e4c7386400ab37efceb8c33c839084ac9","observation_id":"ef842316-cf51-4bb9-a7ce-5973f06ce800","resolution":{"observed_at":"2026-08-11T11:52:37.171818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-11T11:52:37.176676Z","title":"When not to trust language models: Investigating effectiveness and limitations of parametric and non-parametric memories.arXiv preprint arXiv:2212.10511, 7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.176676Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:23f5eab0da261b5f69c7751d84506b34510a90ce6a00b01c14c4835943a7e4e9","observation_id":"d9b8178e-5f41-4a8a-ab2b-ab4c75d8a82d","resolution":{"observed_at":"2026-08-11T11:52:37.176676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00213","last_updated":"2024-04-02T20:09:45Z","snapshot_observed_at":"2026-08-09T06:14:36.567158Z","submitted_at":"2024-03-30T01:56:07Z","title":"Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00213","snapshot_observed_at":"2026-08-11T11:52:37.181478Z","title":"Injecting new knowledge into large language models via supervised fine-tuning.arXiv preprint arXiv:2404.00213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.181478Z"},"links":{"cited_paper":"/paper/2404.00213","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5d0d485f9b6c477675770e00564f61e74d040836ea2514a5a9fc94168b12543a","observation_id":"03a92b77-3952-4e84-b964-e741a3d76cf3","resolution":{"observed_at":"2026-08-11T11:52:37.181478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-09T03:30:58.801577Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-11T11:52:37.186069Z","title":"Orca 2: Teaching small language models how to reason.arXiv preprint arXiv:2311.11045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.186069Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:fb090e508fdc62d3253423ec9b5297334f6aaa9b3808edb9abdf631e2268ff2a","observation_id":"e55a76c8-fa4c-4235-b91f-3c9b16d18ec2","resolution":{"observed_at":"2026-08-11T11:52:37.186069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05686","last_updated":"2020-05-05T00:20:48Z","snapshot_observed_at":"2026-08-10T21:09:46.117612Z","submitted_at":"2020-04-12T19:49:27Z","title":"XtremeDistil: Multi-stage Distillation for Massive Multilingual Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05686","snapshot_observed_at":"2026-08-11T11:52:37.191047Z","title":"Xtremedistil: Multi-stage distillation for massive multilingual models.arXiv preprint arXiv:2004.05686,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.191047Z"},"links":{"cited_paper":"/paper/2004.05686","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c5b8143268f9d0f95ca64896f55b3a1d03d623412f3b722347862cb693689241","observation_id":"26f47e3f-fd91-49cd-95c9-4cc7954909a3","resolution":{"observed_at":"2026-08-11T11:52:37.191047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-11T11:52:37.195772Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4.arXiv preprint arXiv:2306.02707,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.195772Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:e42f5be461416f09d0fbcd5fc658460bdaa9448283e3d91d3d0282468cc6cf28","observation_id":"7fe94a89-d997-4c74-b92f-321de45756cd","resolution":{"observed_at":"2026-08-11T11:52:37.195772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18334","last_updated":"2024-09-11T16:28:29Z","snapshot_observed_at":"2026-08-04T21:38:01.483476Z","submitted_at":"2024-02-28T13:54:57Z","title":"Learning to Generate Instruction Tuning Datasets for Zero-Shot Task Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18334","snapshot_observed_at":"2026-08-11T11:52:37.200189Z","title":"Learning to generate instruction tuning datasets for zero-shot task adaptation.arXiv preprint arXiv:2402.18334,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.200189Z"},"links":{"cited_paper":"/paper/2402.18334","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:69b2f30ff9e7e97ac158696357564c8766ee961be4a9db6c07ecc749118e8ef3","observation_id":"a180c0bd-0333-46ef-aed6-f19a61b16814","resolution":{"observed_at":"2026-08-11T11:52:37.200189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05934","last_updated":"2024-01-30T11:58:10Z","snapshot_observed_at":"2026-08-05T09:41:20.689942Z","submitted_at":"2023-12-10T16:52:00Z","title":"Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05934","snapshot_observed_at":"2026-08-11T11:52:37.204758Z","title":"Fine-tuning or retrieval? comparing knowledge injection in llms.arXiv preprint arXiv:2312.05934,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.204758Z"},"links":{"cited_paper":"/paper/2312.05934","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:50f43eb1953660f908705a6ae5ee10bcdf5b77f15cf649c60f38d63748c5a8db","observation_id":"46ae1da7-bb1f-4efc-9158-6a63d3e710b9","resolution":{"observed_at":"2026-08-11T11:52:37.204758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-11T11:52:37.209209Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.209209Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:a3406117981c16c134ba0cbd25f325846a000d9d0132292dc26c79f8877c4436","observation_id":"a7e5019a-b4ba-410f-b011-5f50298570a3","resolution":{"observed_at":"2026-08-11T11:52:37.209209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11194","last_updated":"2025-03-30T20:10:35Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T04:00:04Z","title":"In-Context Editing: Learning Knowledge from Self-Induced Distributions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11194","snapshot_observed_at":"2026-08-11T11:52:37.213565Z","title":"In-context editing: Learning knowledge from self-induced distributions.arXiv preprint arXiv:2406.11194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.213565Z"},"links":{"cited_paper":"/paper/2406.11194","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:3f3d9a32a3c8cb5f167fd95586665bdec20393fc0c475a2ad32c2950187d5c0a","observation_id":"1154c72e-e39c-4a94-93eb-bcfe8809d26c","resolution":{"observed_at":"2026-08-11T11:52:37.213565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-11T11:52:37.222089Z","title":"Multitask prompted training enables zero-shot task generalization.arXiv preprint arXiv:2110.08207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.222089Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:bd8950232143f0c95a58db908a5afdec3c27f4cc722628465629c92bbaff8024","observation_id":"9f8816d2-bda9-4d46-8d19-94c6926739ec","resolution":{"observed_at":"2026-08-11T11:52:37.222089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12652","last_updated":"2023-05-24T05:08:07Z","snapshot_observed_at":"2026-08-02T02:08:12.414817Z","submitted_at":"2023-01-30T04:18:09Z","title":"REPLUG: Retrieval-Augmented Black-Box Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12652","snapshot_observed_at":"2026-08-11T11:52:37.226208Z","title":"Large language models can be easily distracted by irrelevant context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.226208Z"},"links":{"cited_paper":"/paper/2301.12652","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:9a14881a8c82b05bff1de3aad10b2c29bf6ac03a6da463ac77c6893a3f4b9403","observation_id":"a716a0cc-f600-487b-afc5-c2031fd2c167","resolution":{"observed_at":"2026-08-11T11:52:37.226208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07713","last_updated":"2024-05-29T04:15:39Z","snapshot_observed_at":"2026-08-11T10:08:10.605467Z","submitted_at":"2023-10-11T17:59:05Z","title":"InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07713","snapshot_observed_at":"2026-08-11T11:52:37.230237Z","title":"Instructretro: Instruction tuning post retrieval-augmented pretraining.arXiv preprint arXiv:2310.07713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.230237Z"},"links":{"cited_paper":"/paper/2310.07713","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:3356d55fc9e898140d282cbb4af3df49b6983e390260fa594d0dd49a3a3b4640","observation_id":"ed94ebae-474a-4acb-a0d6-1e8c7e463793","resolution":{"observed_at":"2026-08-11T11:52:37.230237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13618","last_updated":"2024-11-05T13:17:56Z","snapshot_observed_at":"2026-07-06T18:33:45.816337Z","submitted_at":"2024-06-19T15:14:55Z","title":"In-Context Former: Lightning-fast Compressing Context for Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13618","snapshot_observed_at":"2026-08-11T11:52:37.234248Z","title":"In-context former: Lightning-fast compressing context for large language model.arXiv preprint arXiv:2406.13618, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.234248Z"},"links":{"cited_paper":"/paper/2406.13618","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:20a56cc761584ddaeee9b962ef84d5951e627d9d8f375f7dd9a05db7d2e563b8","observation_id":"6a66c2b8-fb06-43a0-8531-eda96ea69d6c","resolution":{"observed_at":"2026-08-11T11:52:37.234248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-11T11:52:37.238593Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.238593Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:6c266a0bad153b59c89b9bc3fc0851397b72e05b52d7580926a18852c22f3ba5","observation_id":"923c68cc-4294-4dd4-a31e-c97c1eb74b92","resolution":{"observed_at":"2026-08-11T11:52:37.238593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10131","last_updated":"2024-06-05T17:27:51Z","snapshot_observed_at":"2026-07-06T17:45:07.023305Z","submitted_at":"2024-03-15T09:26:02Z","title":"RAFT: Adapting Language Model to Domain Specific RAG","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10131","snapshot_observed_at":"2026-08-11T11:52:37.246602Z","title":"Raft: Adapting language model to domain specific rag.arXiv preprint arXiv:2403.10131,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.246602Z"},"links":{"cited_paper":"/paper/2403.10131","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:704219fa30abb22c1698e4cf35f02503fe4145a714c15941a9810941cb879df6","observation_id":"dbb9e362-91b0-48c8-ab4d-527e837e71b0","resolution":{"observed_at":"2026-08-11T11:52:37.246602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.821711Z","title":null,"venue":null,"work_id":"4f4aaaf4-d976-4e13-9294-95b07944d25d","year":2020},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.250250Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5cdd086fc4fa068622eae47d9d99841bd5ec0a9c5d97b7e28b4a6054236a36de","observation_id":"41bedcf0-75ff-4798-ae30-f499cb4282e0","resolution":{"observed_at":"2026-08-11T11:52:37.826001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.807541Z","title":"C Related Work: More Detailed Review of Context Distillation In prior work, context distillation has been used for in-context learning and qualitatively modifying LLM behavior","venue":null,"work_id":"7d7a763f-80d5-40f8-9a58-c6539dd3e6e6","year":2021},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.254877Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:4ccd65c1236ccf1a5d58f67060bf0212212f07330d81de13031646c230d86698","observation_id":"04e9f70e-b46c-466b-8655-729caef3457b","resolution":{"observed_at":"2026-08-11T11:52:37.811775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.792532Z","title":"We found Bonito capable of generating competitive questions for the New York Times dataset","venue":null,"work_id":"0fade3aa-2772-4dbe-b9f9-de805ed9cd98","year":2019},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.258972Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:13a5ce7f8f4061ef0b94aa6db0fb8dd7030a6f1c27f4f6f1dd8eb5d424853d7f","observation_id":"9cbae46e-8cd4-4a99-91cb-f11120cdc24f","resolution":{"observed_at":"2026-08-11T11:52:37.796868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.777549Z","title":"To explore potential factors underlying this phenomenon, we examine two key statistical properties of the teacher model’s outputs:","venue":null,"work_id":"1b06a0c9-8291-4901-a069-61aec19783b2","year":2023},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.262850Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:0e9e2050dbe5888e69f54b94fc39fe7301cca7a976220c4e4ca0fa90835796df","observation_id":"9b9bc418-12e8-4212-bca3-54286de8d69b","resolution":{"observed_at":"2026-08-11T11:52:37.783268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.761404Z","title":"This characteristic may help explain why Llama-3- 8B-Instruct demonstrates superior performance as an expert compared to Qwen2.5-72B-Instruct (Table 3)","venue":null,"work_id":"698d9a2f-ea95-4e32-bcb1-8705c454266a","year":2022},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.266686Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:06a7e4625bf8c420914cd5627ef89939a02114671dfd8679a73602efd237c882","observation_id":"84748132-158c-4def-b593-fbe1bb9e97ad","resolution":{"observed_at":"2026-08-11T11:52:37.766198Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.748863Z","title":"Splendid Cities","venue":null,"work_id":"e3a305d8-9142-4dcf-b2b4-95706e2cf5c3","year":1996},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.270748Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:77c08a7247c4e55068a589491034a6f3b7d6d1d32d3ebb64e48b3e65232343d1","observation_id":"241a108e-0ec2-4009-a715-e53238617d53","resolution":{"observed_at":"2026-08-11T11:52:37.752900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-11T11:52:37.217777Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.217777Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:dfe32ea053d30b330dacd0fcc644d455e19e8478ffda05e57a23a5a902fa8c0c","observation_id":"123ed824-d287-4346-b5ab-1066c915c06f","resolution":{"observed_at":"2026-08-11T11:52:37.217777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T11:52:37.138767Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.138767Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:bd790dfa4d2524034d86269c5187dd40984474e260589ffb30fe8a394baa2688","observation_id":"f5475e12-fc41-4d5d-a90e-3e6d776adc2f","resolution":{"observed_at":"2026-08-11T11:52:37.138767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T11:52:37.157917Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.157917Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:900aec2e94d03b3bc3815080687803030a8c74baf6036cd8e10cd889a706b22c","observation_id":"8b57b03b-a881-4fed-b327-2bbbb52cb362","resolution":{"observed_at":"2026-08-11T11:52:37.157917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09089","last_updated":"2024-04-17T15:18:54Z","snapshot_observed_at":"2026-08-11T03:36:44.183155Z","submitted_at":"2023-10-13T13:17:03Z","title":"Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09089","snapshot_observed_at":"2026-08-11T11:52:37.242707Z","title":"Qilin-med: Multi-stage knowledge injection advanced medical large language model.arXiv preprint arXiv:2310.09089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.242707Z"},"links":{"cited_paper":"/paper/2310.09089","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:92f9ac83f33ded35dc3c08b51cae2aa402e640b3ac118f878b10d14e2f57cdd8","observation_id":"54ab17d3-19ec-4103-9bdb-3bbfe2983a89","resolution":{"observed_at":"2026-08-11T11:52:37.242707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11349","last_updated":"2022-07-15T07:15:31Z","snapshot_observed_at":"2026-08-03T15:47:56.044506Z","submitted_at":"2022-05-31T08:43:07Z","title":"Prompt Injection: Parameterization of Fixed Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11349","snapshot_observed_at":"2026-08-11T11:52:37.108513Z","title":"Prompt injection: Parameterization of fixed inputs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.108513Z"},"links":{"cited_paper":"/paper/2206.11349","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:9291e747348112b128154779cb160045f7aaf5a283ea93622f92d953cf4e9b83","observation_id":"072dd78b-6d67-4811-a065-c09d41319785","resolution":{"observed_at":"2026-08-11T11:52:37.108513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13788","last_updated":"2020-10-18T22:49:31Z","snapshot_observed_at":"2026-07-06T08:25:47.087616Z","submitted_at":"2019-09-30T15:30:00Z","title":"Revisiting Self-Training for Neural Sequence Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.13788","snapshot_observed_at":"2026-08-11T11:52:37.129494Z","title":"Revisiting self-training for neural sequence generation.arXiv preprint arXiv:1909.13788,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.129494Z"},"links":{"cited_paper":"/paper/1909.13788","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:d1a2afcfb0dded143747f23b94fb5e0aa0801d3674e6bfc00eaf8294f7d32846","observation_id":"992cede1-a7a6-4848-b9c0-527f3f93f629","resolution":{"observed_at":"2026-08-11T11:52:37.129494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07646","last_updated":"2023-03-06T06:28:18Z","snapshot_observed_at":"2026-08-03T19:51:05.627063Z","submitted_at":"2022-02-15T18:48:31Z","title":"Quantifying Memorization Across Neural Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07646","snapshot_observed_at":"2026-08-11T11:52:37.099890Z","title":"Quantifying memorization across neural language models.arXiv preprint arXiv:2202.07646,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.099890Z"},"links":{"cited_paper":"/paper/2202.07646","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:90397406bbe6826d4fbb563da2e67cca0961669bad24aa724f7d2c9f2aa820fc","observation_id":"3973a647-d213-43d5-a2d9-69ab10f3e25e","resolution":{"observed_at":"2026-08-11T11:52:37.099890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.095907Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.095907Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:7de22d9deafb30c923ce33fac8b884fae2fac3b720056432f872b6eb2629b16a","observation_id":"5740aedf-cc3a-4b95-bee8-5e89c618310e","resolution":{"observed_at":"2026-08-11T11:52:37.095907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08406","last_updated":"2024-01-30T13:55:34Z","snapshot_observed_at":"2026-08-10T18:29:59.294229Z","submitted_at":"2024-01-16T14:44:47Z","title":"RAG vs Fine-tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08406","snapshot_observed_at":"2026-08-11T11:52:37.121350Z","title":"Rag vs fine-tuning: Pipelines, tradeoffs, and a case study on agriculture.arXiv preprint arXiv:2401.08406,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.121350Z"},"links":{"cited_paper":"/paper/2401.08406","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:94ca1ed3b1b67b220fcda695deb4902852065de01d01bb89ee4ccdc134af30a8","observation_id":"2a09967e-9457-49e0-a6fd-06aa0687e991","resolution":{"observed_at":"2026-08-11T11:52:37.121350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T11:52:37.091278Z","title":"Accessed: 2024- 12-02","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.091278Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:8b1b44fcb864a4256498841f9069054838aabc3cf01f6eb3ec4c2a616164e196","observation_id":"28f18322-0f4e-4095-974c-ca52efd91650","resolution":{"observed_at":"2026-08-11T11:52:37.091278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T11:43:16.717048Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2412.14964."}