{"as_of":"2026-08-08T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bedadeb255c3689c5b9a79566b4ee6c95335a6ff7e12b98fbe7dfc2300faf9bb","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:25.825552Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T11:55:50.897500Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T11:55:51.079688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"cited_work":{"arxiv_id":"2506.15702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minifinetuning: Low-data gen- eration domain adaptation through corrective self-distillation","venue":null,"work_id":"5037cff1-83c4-4d98-a1ab-1a23805b55de","year":2025},"citing_paper":{"arxiv_id":"2506.02153","last_updated":"2025-09-15T22:15:00Z","snapshot_observed_at":"2026-08-05T18:56:11.132981Z","submitted_at":"2025-06-02T18:35:16Z","title":"Small Language Models are the Future of Agentic AI","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T11:55:50.897500Z"},"links":{"cited_paper":"/paper/2506.15702","citing_paper":"/paper/2506.02153"},"observation_digest":"sha256:a9f2b939e9a096e2967ae91db23ec4327cd0a94954eb9393d699ae4131b01082","observation_id":"7bfa0aa3-81b3-4c95-96b7-4eddc78029c9","resolution":{"observed_at":"2026-05-16T11:55:51.081789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15702/citation-record","integrity":"/paper/2506.15702/integrity","json":"/paper/2506.15702/citation-record.json","paper":"/paper/2506.15702"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.328062Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning","venue":null,"work_id":"414b87ef-4e3d-4e80-af09-78c7fec99aa8","year":1950},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:21.901340Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:e44de568303e48b3ba901138d2f635cd00bdb0f8e656a7d14fd570dd93e94417","observation_id":"b9924e1f-e1e8-4d68-ae66-05b90dd5e44a","resolution":{"observed_at":"2026-08-07T12:40:28.392773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-04T02:30:25.691953Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-07T12:40:21.984686Z","title":"Fine-tuning can distort pretrained features and underperform out-of-distribution.arXiv preprint arXiv:2202.10054 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:21.984686Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:9f94f693a40ff5e8ca54ff2d36d94cb9d8cebaf027f9c21033ba1089f87465b1","observation_id":"2166bd8d-13a3-4ede-b97d-d8758d1b375e","resolution":{"observed_at":"2026-08-07T12:40:21.984686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.129171Z","title":"Distill and replay for continual language learning","venue":null,"work_id":"45e69087-e8ea-4fca-970c-85b87b342226","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.104922Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:45fc9499eed49f34de625d44e1016339d52ce0f1ae3ce46e2af985456c867857","observation_id":"36d6d8aa-9349-4e21-82e5-716189de53a6","resolution":{"observed_at":"2026-08-07T12:40:28.237234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07470","last_updated":"2024-04-11T04:22:15Z","snapshot_observed_at":"2026-08-07T09:52:49.159319Z","submitted_at":"2024-04-11T04:22:15Z","title":"Scalable Language Model with Generalized Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07470","snapshot_observed_at":"2026-08-07T12:40:22.174315Z","title":"Scalable language model with generalized continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.174315Z"},"links":{"cited_paper":"/paper/2404.07470","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:f9b9460cdcac007b2381038a3a9a27c6fc4a71e5b67ec0e87814410cb8cc79c1","observation_id":"0136af4c-2c5a-43b4-bca9-15aa968675cf","resolution":{"observed_at":"2026-08-07T12:40:22.174315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16789","last_updated":"2024-11-25T05:27:13Z","snapshot_observed_at":"2026-08-06T00:13:40.325158Z","submitted_at":"2024-04-25T17:38:57Z","title":"Continual Learning of Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16789","snapshot_observed_at":"2026-08-07T12:40:22.228275Z","title":"Continual learning of large language models: A comprehensive survey.arXiv preprint arXiv:2404.16789 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.228275Z"},"links":{"cited_paper":"/paper/2404.16789","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:552669501095049176772a595c7d360995464d51f58cc1f7215582510367f5fd","observation_id":"d27f66ef-674d-47ad-9826-b7b39c8ef32e","resolution":{"observed_at":"2026-08-07T12:40:22.228275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:40:22.273316Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.273316Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:57590f797a589664947426ef247413d3ed30f2b07d988049d1d7f864f45d222b","observation_id":"ada8e617-2b84-4a42-81c6-6ece30a7ae44","resolution":{"observed_at":"2026-08-07T12:40:22.273316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.325270Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.325270Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:0ee06e9535157e7dee7cafae49c5ed4d5865157e5b27fba0a4cd6a6acaaa7c02","observation_id":"532801a0-376d-414e-9637-7faeb31f872b","resolution":{"observed_at":"2026-08-07T12:40:22.325270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T12:40:22.403153Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685 , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.403153Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:df7e3b53b6b4d74ee560e9194df92389a8a69b546957e925d7f50a28d75c8f8f","observation_id":"03c095da-ffbb-4ca9-9bf5-dac60207c9b0","resolution":{"observed_at":"2026-08-07T12:40:22.403153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-07T12:40:22.478505Z","title":"Dora: Weight-decomposed low-rank adaptation.arXiv preprint arXiv:2402.09353 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.478505Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:c3bd2175f37e0a952cac6ca45a035c5432cef4c7b169c7dded916e761b31f929","observation_id":"7e690718-46dd-42f6-b1a3-406a06b9cc7a","resolution":{"observed_at":"2026-08-07T12:40:22.478505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.900492Z","title":"Mitigating the alignment tax of rlhf, 2024","venue":null,"work_id":"ca7d122e-1625-4de2-85b6-79b207fabb12","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.563915Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:552e714cf36b8349ab2a37b0c1ac56f6af8dd802bc9f45aa4ec7df78b37e7227","observation_id":"4dce038a-5dd7-40d0-a31c-5a324fb5d4c7","resolution":{"observed_at":"2026-08-07T12:40:28.001975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-07T09:28:48.845112Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-07T12:40:22.685924Z","title":"Reuse, don’t retrain: A recipe for continued pretraining of language models.arXiv preprint arXiv:2407.07263 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.685924Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:a1b9dc767a9b53b181ea535ed8405724fad0258c7e923bfd2442f0920ea74ccd","observation_id":"131f8fd6-9ce0-4c47-9148-a405da58db28","resolution":{"observed_at":"2026-08-07T12:40:22.685924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00409","last_updated":"2019-06-30T16:32:28Z","snapshot_observed_at":"2026-07-31T08:47:31.689663Z","submitted_at":"2019-06-30T16:32:28Z","title":"Evaluating Language Model Finetuning Techniques for Low-resource Languages","version":1},"cited_work":{"arxiv_id":"1907.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00409","snapshot_observed_at":"2026-08-07T12:40:26.952893Z","title":"Evaluating Language Model Finetuning Techniques for Low-resource Languages","venue":"cs.CL","work_id":"dccb32e9-f3f7-4cf3-9b9c-c9af7a00878f","year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.799461Z"},"links":{"cited_paper":"/paper/1907.00409","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:80164fc58e080e62a5e85b014c1678402d404798714dff1775b1091c0a590f65","observation_id":"e32bdeb5-a6b0-4a28-9b14-b1b1c7ddcb8a","resolution":{"observed_at":"2026-08-07T12:40:27.015634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02981","last_updated":"2024-01-24T18:16:34Z","snapshot_observed_at":"2026-07-06T17:12:06.715778Z","submitted_at":"2024-01-01T06:22:04Z","title":"Fine-tuning and Utilization Methods of Domain-specific LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02981","snapshot_observed_at":"2026-08-07T12:40:22.930321Z","title":"Fine-tuning and utilization methods of domain-specific llms.arXiv preprint arXiv:2401.02981 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.930321Z"},"links":{"cited_paper":"/paper/2401.02981","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:7a41332b9e27902395a803e21be98d09ed38c8990ee7498a6b830c38ab9f7ab7","observation_id":"56542d17-5577-4ebc-bd31-b1ba87260097","resolution":{"observed_at":"2026-08-07T12:40:22.930321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.677546Z","title":"Harnessing pre-trained neural networks with rules for formality style transfer","venue":null,"work_id":"b00a1b63-a7a4-4887-b9c4-ff70ec5a0314","year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.069557Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:ba8814f4123b2a94469d56c52685d03be6dc1ac0ad90ca84dfe20462d156ce37","observation_id":"534cfb67-86f9-4389-8742-ee595b0b2694","resolution":{"observed_at":"2026-08-07T12:40:27.784303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.184609Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.184609Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:104023f9302c0140458feffba8ad4ae0aae6139a5358f0a8af621b8f1c5e78a9","observation_id":"b23a30d4-143b-4992-bb28-64b1b23c7ccf","resolution":{"observed_at":"2026-08-07T12:40:23.184609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T12:40:23.283185Z","title":"Openelm: An efficient language model family with open-source training and inference framework.arXiv preprint arXiv:2404.14619 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.283185Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:184e9e5f4f372fcdfed95b0db819b297668d16c2735b384ac4f91e91933c6334","observation_id":"8d64e5a8-a154-4bab-af04-d1c6479caf9d","resolution":{"observed_at":"2026-08-07T12:40:23.283185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.479856Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow, March 2021","venue":null,"work_id":"e163bfd9-45ab-47a3-8ede-bff4437fa6e1","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.356559Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:79341133020e11def42ad6038d48066d8cb484f74c5d8c7715d9f5f7e41bb1c5","observation_id":"9bb6b675-a755-4d53-8141-790b5eed44ef","resolution":{"observed_at":"2026-08-07T12:40:27.545350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-07T12:40:23.446594Z","title":"Textbooks are all you need.arXiv preprint arXiv:2306.11644, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.446594Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:4d92e09378d7efbc738cc233db7a6672ab8e4fa5b3d7e44e585f168748f08189","observation_id":"11a82b97-dbbc-4169-b6ec-fca206eccbb0","resolution":{"observed_at":"2026-08-07T12:40:23.446594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:40:23.571712Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.571712Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:a5d00a712887709f74be6e1c4a373321615ddb32b6ecdae1e5076ca160ee8f73","observation_id":"21135899-76bd-4f7a-8647-ee4c8f05deb1","resolution":{"observed_at":"2026-08-07T12:40:23.571712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T12:40:23.706659Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.706659Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:55f130dbed92c58102199b81a9a7af618b1dc918363d795e54c39aaad2cec506","observation_id":"fe04fba2-d9cc-488d-b5e8-d4df9cfc286d","resolution":{"observed_at":"2026-08-07T12:40:23.706659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14679","last_updated":"2024-11-04T17:36:38Z","snapshot_observed_at":"2026-07-06T18:49:20.859618Z","submitted_at":"2024-07-19T21:47:57Z","title":"Compact Language Models via Pruning and Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14679","snapshot_observed_at":"2026-08-07T12:40:23.840008Z","title":"Compact language models via pruning and knowledge distillation.arXiv preprint arXiv:2407.14679 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.840008Z"},"links":{"cited_paper":"/paper/2407.14679","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:6d21a90519ec9706c08aa92cf7a29dc67cf9c4d69acee369eecbad94971621ff","observation_id":"7e664326-fcfb-4341-93bd-a253106a72d5","resolution":{"observed_at":"2026-08-07T12:40:23.840008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:40:23.979348Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.979348Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:efd6c668f4195b05d2026e95b8ba9dc0068397507afcc4f568c1138ca240a984","observation_id":"6cdce6dd-8b70-4fad-a826-1650997c087c","resolution":{"observed_at":"2026-08-07T12:40:23.979348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.467617Z","title":"Pmc open access subset, 2024","venue":null,"work_id":"2b6cdf2b-590d-45dd-ae91-a999740d8304","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.123062Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:27e1bc5fd2b34b55f90d7a7afe810344a32359dbd5a163ca84345a9515742e56","observation_id":"cc2d33b2-30b3-4a3d-9087-042ebf2fee62","resolution":{"observed_at":"2026-08-07T12:40:27.471214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.455193Z","title":"Pile of law: Learning responsible data filtering from the law and a 256gb open-source legal dataset.Advances in Neural Information Processing Systems , 35:29217–29234, 2022","venue":null,"work_id":"a6455248-1bd2-4d26-8fdc-e16074d439bf","year":2022},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.342357Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:4078eca065e5d7e01b013fd0205c96135f10effe0fdd1d84b39a31b35baa120a","observation_id":"524998d2-3a98-4b65-99c1-2dd8583bbe0a","resolution":{"observed_at":"2026-08-07T12:40:27.459928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-02T22:16:20.939859Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-07T12:40:24.492611Z","title":"Openwebmath: An open dataset of high-quality mathematical web text.arXiv preprint arXiv:2310.06786 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.492611Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:e0f4352e29823b1e3a448f7c39baf68b09f369e0fa3f50cb8df6b25ad0beba97","observation_id":"d09cf018-66b7-4013-89e9-aaaf55cc60bd","resolution":{"observed_at":"2026-08-07T12:40:24.492611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.639960Z","title":"Openwebtext corpus.http://Skylion007.github.io/OpenWebTextCorpus, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.639960Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:06e97656721b751a27925075574e505746877d58ce7f9085c155dca1cf0843bb","observation_id":"a18c343b-6f9f-479d-bd70-10bd5032dfee","resolution":{"observed_at":"2026-08-07T12:40:24.639960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08786","last_updated":"2022-05-03T17:05:22Z","snapshot_observed_at":"2026-08-03T02:40:20.212669Z","submitted_at":"2021-12-16T11:09:29Z","title":"Efficient Hierarchical Domain Adaptation for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2112.08786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08786","snapshot_observed_at":"2026-08-07T12:40:26.676081Z","title":"Efficient Hierarchical Domain Adaptation for Pretrained Language Models","venue":"cs.CL","work_id":"2986f569-0e98-4a23-87cb-8da85171e404","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.757051Z"},"links":{"cited_paper":"/paper/2112.08786","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:52f960d13b5dfe9b64eab2936c492b704247fcc0589133eddd5a302bea9f92cc","observation_id":"4eede3ac-a845-4b0c-9f0b-a20b36f93a73","resolution":{"observed_at":"2026-08-07T12:40:26.744067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11499","last_updated":"2020-11-23T16:00:42Z","snapshot_observed_at":"2026-08-06T16:52:32.232402Z","submitted_at":"2020-11-23T16:00:42Z","title":"Unsupervised Domain Adaptation of a Pretrained Cross-Lingual Language Model","version":1},"cited_work":{"arxiv_id":"2011.11499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.11499","snapshot_observed_at":"2026-08-07T12:40:26.490234Z","title":"Unsupervised Domain Adaptation of a Pretrained Cross-Lingual Language Model","venue":"cs.CL","work_id":"c96d5335-e3bf-4801-8d60-f8d0ae3921fc","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.874023Z"},"links":{"cited_paper":"/paper/2011.11499","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:d51c12dbc66a4e56ec47892953bcaf593fd449b8d7d09efc3ec62d88e9d38efe","observation_id":"f1304c0c-a8c7-4e9b-84bc-03d556617291","resolution":{"observed_at":"2026-08-07T12:40:26.595401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01739","last_updated":"2020-10-05T01:49:47Z","snapshot_observed_at":"2026-07-06T10:01:23.472948Z","submitted_at":"2020-10-05T01:49:47Z","title":"Effective Unsupervised Domain Adaptation with Adversarially Trained Language Models","version":1},"cited_work":{"arxiv_id":"2010.01739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01739","snapshot_observed_at":"2026-08-07T12:40:26.228060Z","title":"Effective Unsupervised Domain Adaptation with Adversarially Trained Language Models","venue":"cs.CL","work_id":"7f717ba9-dd57-4e87-a5c6-6531ee76c498","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.989842Z"},"links":{"cited_paper":"/paper/2010.01739","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:e3bf6aeb5631287e7ae639767d287bfb8206d2447bdc888d1ab9bcd6332d595a","observation_id":"377d1690-53c8-4f96-bc5a-5f4d6375b1cd","resolution":{"observed_at":"2026-08-07T12:40:26.349803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.327506Z","title":"Taming pre-trained language models with n-gram representations for low-resource domain adaptation","venue":null,"work_id":"7bb107de-14c3-4092-9fc8-73d65d077d09","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.065622Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:48ca1fddd95925a862732e5f9dece317e209afdfe6a1e0033742d1b2888dd936","observation_id":"f77d5e94-3af4-4021-ab8b-ad69c2b76e30","resolution":{"observed_at":"2026-08-07T12:40:27.380758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10879","last_updated":"2023-02-21T18:54:21Z","snapshot_observed_at":"2026-07-06T14:54:15.390552Z","submitted_at":"2023-02-21T18:54:21Z","title":"$k$NN-Adapter: Efficient Domain Adaptation for Black-Box Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10879","snapshot_observed_at":"2026-08-07T12:40:25.154848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.154848Z"},"links":{"cited_paper":"/paper/2302.10879","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:557ba0af9b572f65e54430516ef352b771f075d1986190226ac97025ee4b4d43","observation_id":"c681321b-25d0-4ae3-aa35-cdf10623bde8","resolution":{"observed_at":"2026-08-07T12:40:25.154848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-05T06:19:25.316529Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-07T12:40:25.256358Z","title":"Maybe only 0.5% data is needed: A preliminary exploration of low training data instruction tuning.arXiv preprint arXiv:2305.09246, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.256358Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:c3ff8609f14408f96b3c5fb22a5ca63d71a34b9ec8936e118e14163366a1e8ec","observation_id":"a36c054a-8148-4258-b397-d8431c44bc66","resolution":{"observed_at":"2026-08-07T12:40:25.256358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04212","last_updated":"2024-04-05T16:42:28Z","snapshot_observed_at":"2026-08-08T00:17:51.924289Z","submitted_at":"2024-04-05T16:42:28Z","title":"Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation","version":1},"cited_work":{"arxiv_id":"2404.04212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04212","snapshot_observed_at":"2026-08-07T12:40:25.995616Z","title":"Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation","venue":"cs.CL","work_id":"090325aa-75d3-47f6-b86d-836c3a7871d7","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.450479Z"},"links":{"cited_paper":"/paper/2404.04212","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:42ae5d72b9f3124d6fdc885c9fb62b1c9464b3fbdbfadc1efd01c315f9fb9546","observation_id":"85ad0bf9-ec45-4b43-851f-dc2ee4ff90f2","resolution":{"observed_at":"2026-08-07T12:40:26.067733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17193","last_updated":"2024-02-27T04:18:49Z","snapshot_observed_at":"2026-08-04T05:29:23.231087Z","submitted_at":"2024-02-27T04:18:49Z","title":"When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17193","snapshot_observed_at":"2026-08-07T12:40:25.565467Z","title":"When scaling meets llm finetuning: The effect of data, model and finetuning method.arXiv preprint arXiv:2402.17193 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.565467Z"},"links":{"cited_paper":"/paper/2402.17193","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:90f8189dc6f959a40c69f8374af741d91582bfaa4b9b8a884a38d640af7f2c77","observation_id":"0caa0043-5f84-482e-b6ae-cc4d4164c229","resolution":{"observed_at":"2026-08-07T12:40:25.565467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13669","last_updated":"2024-05-28T06:39:17Z","snapshot_observed_at":"2026-07-06T17:33:21.399878Z","submitted_at":"2024-02-21T10:06:08Z","title":"Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13669","snapshot_observed_at":"2026-08-07T12:40:25.692005Z","title":"Self-distillation bridges distribution gap in language model fine-tuning.arXiv preprint arXiv:2402.13669 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.692005Z"},"links":{"cited_paper":"/paper/2402.13669","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:8cf5664668d86c43d255a0b64615edccc1ffebc13fe9109991c4199f51e3fafc","observation_id":"1b8f02e8-aba9-43d0-b476-ed70cce6d159","resolution":{"observed_at":"2026-08-07T12:40:25.692005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.180770Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"80f3649b-70e4-434b-a55e-6d76e0acacd7","year":2017},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.825552Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:6dcf6b5dbc54447031347a50a9c5dc2e0bc3d205149170704a8de8bb5fa9ba8d","observation_id":"2280a8ac-60dc-470b-82a0-579ba4d0cba4","resolution":{"observed_at":"2026-08-07T12:40:27.239667Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:31:12.512651Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":5,"verified_fuzzy":8},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.15702."}