{"as_of":"2026-08-07T20:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2f173ba28eda588df3395a003d0a5ad8ded6edac50457b4616572bc5041203a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:25:05.166635Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":216,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:46:18.486086Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2009.01325"},"observation_digest":"sha256:acec5936ea68101e736acca56a0f95f6ba38d59a4d92a8d3d094b1f9f04ad789","observation_id":"99b8bf49-1363-404e-aeac-d67604dc7577","resolution":{"observed_at":"2026-05-18T01:46:18.549473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T08:09:12.716163Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2212.04089"},"observation_digest":"sha256:646ffdd6dfc08f5a22d8d4456e68fb93ace8974978a870d484d0aa7efc8dd3aa","observation_id":"afa31a33-3065-4a80-b260-884b4fb6ebde","resolution":{"observed_at":"2026-05-13T08:09:12.915111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-17T02:11:36.932541Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2502.03387"},"observation_digest":"sha256:c9b75b7e7272ad156aefaa9272c3ea8aec9cf077db44dfc1360c89321e30ef44","observation_id":"47d63d2b-5a44-4e1e-9950-9b31a0884199","resolution":{"observed_at":"2026-05-17T02:11:37.389452Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T13:25:05.166635Z","title":"Fine- tuning pretrained language models: Weight initializations, data orders, and early stopping","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.21857","last_updated":"2025-05-28T01:03:28Z","snapshot_observed_at":"2026-08-07T13:18:48.859573Z","submitted_at":"2025-05-28T01:03:28Z","title":"Revisiting Bayesian Model Averaging in the Era of Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:05.166635Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2505.21857"},"observation_digest":"sha256:ae62929a6ac8f4d5dbea3f0b83c516d95ebb7779b616b2f41353fc854b54814a","observation_id":"931f7b98-c0b7-4002-a349-0c72d5c17338","resolution":{"observed_at":"2026-08-07T13:25:05.166635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T12:02:52.397171Z","title":"arXiv preprint arXiv:2002.06305 (2020) https://doi.org/10.48550/ arXiv.2002.06305","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00788","last_updated":"2025-06-01T02:33:40Z","snapshot_observed_at":"2026-08-07T11:55:38.382066Z","submitted_at":"2025-06-01T02:33:40Z","title":"Behavioral Augmentation of UML Class Diagrams: An Empirical Study of Large Language Models for Method Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:52.397171Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.00788"},"observation_digest":"sha256:02ba2449b7015fb1b0c930daa050192fc063b19137a8af69ea495eb8de3e6513","observation_id":"66db38e6-6110-49fd-a4ed-4db14092ef50","resolution":{"observed_at":"2026-08-07T12:02:52.397171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T11:45:37.662426Z","title":"Fine-tuning pretrained language models: Weight initializa- tions, data orders, and early stopping,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.01631","last_updated":"2025-07-03T15:36:23Z","snapshot_observed_at":"2026-08-07T11:34:48.767068Z","submitted_at":"2025-06-02T13:08:01Z","title":"Gradient-Based Model Fingerprinting for LLM Similarity Detection and Family Classification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:45:37.662426Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.01631"},"observation_digest":"sha256:25a8382acfb7414d778b920e934f15f378cda9cee73ab3cb7a763b905818c758","observation_id":"b2940480-ba75-4f17-9cc1-20080a795505","resolution":{"observed_at":"2026-08-07T11:45:37.662426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T11:04:06.940032Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-07T12:09:45.031691Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.940032Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:83c6339b1b23cc2a71ea56a7c0fe57d48f379bfb2465dd0a57f748edd389d1e4","observation_id":"79f2caed-bde8-4a7a-88e4-8b78accb4f8e","resolution":{"observed_at":"2026-08-07T11:04:06.940032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-07T01:08:58.370021Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11903","last_updated":"2026-06-01T11:28:04Z","snapshot_observed_at":"2026-08-07T00:58:46.860588Z","submitted_at":"2025-06-13T15:53:17Z","title":"GeistBERT: Breathing Life into German NLP","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:58.370021Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.11903"},"observation_digest":"sha256:f4a5ad12ae84d3128a836808cd281c463617a095354f2561a67b24823b0c3233","observation_id":"67031d66-ee9b-4206-bcf1-c8a8d09c266d","resolution":{"observed_at":"2026-08-07T01:08:58.370021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-06T21:58:12.293683Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping.arXiv preprint arXiv:2002.06305, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.23335","last_updated":"2025-07-16T16:03:51Z","snapshot_observed_at":"2026-08-06T21:43:05.910863Z","submitted_at":"2025-06-29T17:09:58Z","title":"Breaking a Logarithmic Barrier in the Stopping Time Convergence Rate of Stochastic First-order Methods","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:12.293683Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2506.23335"},"observation_digest":"sha256:326b68b51f40f37172e55361a868a007e4ac266899363f64b85939a31483a795","observation_id":"022713d0-2942-4f9d-bdb6-55ae00c8bcbc","resolution":{"observed_at":"2026-08-06T21:58:12.293683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2507.00994","last_updated":"2026-05-05T08:00:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-01T17:45:48Z","title":"Should We Still Pretrain Encoders with Masked Language Modeling?","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T06:31:37.201344Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2507.00994"},"observation_digest":"sha256:a9bd91f9f7a92633068be071245cf6a0bb376b64b8e0cc8691a4e547dbd9a6e2","observation_id":"e77693ec-4bdf-40a8-a9a4-c9f12bf8f1e5","resolution":{"observed_at":"2026-05-19T06:32:07.608630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-06T19:10:28.427648Z","title":"Dodge, G","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06445","last_updated":"2026-07-21T16:59:32Z","snapshot_observed_at":"2026-08-06T19:01:43.243592Z","submitted_at":"2025-07-08T23:07:33Z","title":"Can Interpretation Predict Behavior on Unseen Data?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:28.427648Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2507.06445"},"observation_digest":"sha256:7a1f63c04b77681a8b37ab27f715a1be87845e37bbb5278e39b0d739431a400d","observation_id":"8ee894d9-55b1-49dd-870c-d18c85448a54","resolution":{"observed_at":"2026-08-06T19:10:28.427648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-06T17:03:41.362392Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.12004","last_updated":"2025-07-16T07:58:20Z","snapshot_observed_at":"2026-08-07T12:43:44.020373Z","submitted_at":"2025-07-16T07:58:20Z","title":"Improving Data and Parameter Efficiency of Neural Language Models Using Representation Analysis","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T17:03:41.362392Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2507.12004"},"observation_digest":"sha256:a240f615c6fcb5bc4d2c3610c0c3ccc031629df2d15c7219f2a2cfb75a305353","observation_id":"c0dbd269-8080-4cb3-937d-35fa7a6e832a","resolution":{"observed_at":"2026-08-06T17:03:41.362392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-06T14:13:06.458268Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.458268Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:9a0e1573300ab633e7cf1c0a27f9f3ec2366023e7451e13c4f70120b13d7db65","observation_id":"71b7df51-d7ec-4042-8fb5-cb1fa778e286","resolution":{"observed_at":"2026-08-06T14:13:06.458268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:e75d72f90acaf4273cbaa54fb2b65763e89ee460b8db368e96bbb8dfc73852f9","observation_id":"372fe7b1-d6a9-4fdd-90dd-37a98ba3ad85","resolution":{"observed_at":"2026-05-18T22:21:53.341085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T12:56:40.554825Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01193","last_updated":"2025-09-01T07:24:11Z","snapshot_observed_at":"2026-08-06T06:14:22.111826Z","submitted_at":"2025-09-01T07:24:11Z","title":"LobRA: Multi-tenant Fine-tuning over Heterogeneous Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:56:40.554825Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2509.01193"},"observation_digest":"sha256:9dc910382400f63ab3bd9033c4e158991a13b3901a403da930522b177506b9d6","observation_id":"17266caa-5e18-4b01-9029-9b298e9c4a77","resolution":{"observed_at":"2026-08-05T12:56:40.554825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-04T08:22:13.081531Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.21364","last_updated":"2026-06-01T11:38:51Z","snapshot_observed_at":"2026-08-07T10:09:07.484130Z","submitted_at":"2025-10-24T11:48:49Z","title":"SindBERT, the Sailor: Charting the Seas of Turkish NLP","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T08:22:13.081531Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2510.21364"},"observation_digest":"sha256:bf98e03c3b41e797e530f4428428fdd2a6dfdb0662708ff54bf6b69665cc237c","observation_id":"d233f646-f69c-43cf-811c-201b5b3eebc7","resolution":{"observed_at":"2026-08-04T08:22:13.081531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-03T19:15:52.462406Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping.arXiv:2002.06305, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.01461","last_updated":"2026-06-29T13:53:53Z","snapshot_observed_at":"2026-08-03T19:15:49.270551Z","submitted_at":"2025-12-01T09:47:17Z","title":"Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:15:52.462406Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2512.01461"},"observation_digest":"sha256:c8b5a057e59d1a2e9d3d63ee26b7d5a940b0fbb7c9ba2e74666220e404f2437b","observation_id":"21fea34f-8013-43e0-a42d-cb2833372c9d","resolution":{"observed_at":"2026-08-03T19:15:52.462406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-03T15:38:43.752637Z","title":"Fine-tuning pretrained language models: Weight initializa- tions, data orders, and early stopping,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.16292","last_updated":"2025-12-21T20:55:37Z","snapshot_observed_at":"2026-08-07T16:17:52.207021Z","submitted_at":"2025-12-18T08:26:26Z","title":"In-Context Probing for Membership Inference in Fine-Tuned Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T15:38:43.752637Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2512.16292"},"observation_digest":"sha256:b1b86f3ed3c37cbfe46971d4ee17e3ded1ae69faf27c9eaabe510e9403bf1e77","observation_id":"6fa9eb8a-cea6-47fe-86f3-d622164bb94b","resolution":{"observed_at":"2026-08-03T15:38:43.752637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-03T10:56:21.770183Z","title":"InAdvances in Neural Infor- mation Processing Systems, volume 36","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.08146","last_updated":"2026-05-26T09:11:09Z","snapshot_observed_at":"2026-08-07T08:58:13.014897Z","submitted_at":"2026-01-13T02:20:53Z","title":"Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T10:56:21.770183Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2601.08146"},"observation_digest":"sha256:dac8f71823a7a90c74aab2db6391ec9f059d0aeefbdabdf20c8a93454a88824b","observation_id":"aa8e59b5-9381-4230-9af2-ba4fe17b6c80","resolution":{"observed_at":"2026-08-03T10:56:21.770183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:5ee5e52bb60fa5e3ee3c629bbf9fc3ce023ed33525fde4749410c5954904f21f","observation_id":"7c8a1f8c-512f-4627-a737-1e2586556a52","resolution":{"observed_at":"2026-05-16T05:37:24.444353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2604.02937","last_updated":"2026-04-03T10:08:53Z","snapshot_observed_at":"2026-08-02T18:04:55.530371Z","submitted_at":"2026-04-03T10:08:53Z","title":"If It's Good Enough for You, It's Good Enough for Me: Transferability of Audio Sufficiencies across Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T18:53:48.881039Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2604.02937"},"observation_digest":"sha256:90d59d80d70fea1017d1db98a04b1edd218a76f51ee57decc3897d53fb2125cb","observation_id":"363af6f4-f403-4ab6-98fa-81ecc4229353","resolution":{"observed_at":"2026-05-13T18:58:08.985758Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2604.22464","last_updated":"2026-04-24T11:35:53Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T11:35:53Z","title":"Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T12:16:22.278245Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2604.22464"},"observation_digest":"sha256:99e6faeb92c3f5efcc1fc2e7b9861ba04f0654e45bf7dbf1f236a707a1216b59","observation_id":"38a09036-9f9e-4b69-b036-4e492a8d5e0b","resolution":{"observed_at":"2026-05-11T19:21:07.214859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.02608","last_updated":"2026-05-04T13:55:32Z","snapshot_observed_at":"2026-08-03T02:35:07.656763Z","submitted_at":"2026-05-04T13:55:32Z","title":"Dependency Parsing Across the Resource Spectrum: Evaluating Architectures on High and Low-Resource Languages","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T19:36:09.771806Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.02608"},"observation_digest":"sha256:96c5d2b799d53c03edb1e6cae9e3161f8fbc0b0f8ae467b09deb37d134511039","observation_id":"047e66d7-5297-43eb-959f-2de1f40b206f","resolution":{"observed_at":"2026-05-09T05:45:21.657339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-05T18:10:32.435834Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":1},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-05-13T03:09:02.902912Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:f72fafd9f14dc66d60f997920b48e35039815f349e7e016ddd39808c657b69de","observation_id":"5ca5e47a-f5e4-4711-a8cd-5d314f4cd172","resolution":{"observed_at":"2026-05-13T03:12:09.663244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.11206","last_updated":"2026-05-13T08:57:14Z","snapshot_observed_at":"2026-08-05T18:10:32.435834Z","submitted_at":"2026-05-11T20:21:04Z","title":"Instructions Shape Production of Language, not Processing","version":2},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:02.135970Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.11206"},"observation_digest":"sha256:d2456e52e4679d9f24c8241f60ddabfeb5a10d35a09d9a865b0d77886f36a61b","observation_id":"f6984efe-51e9-4b11-8b18-944aa6f334d4","resolution":{"observed_at":"2026-05-14T21:02:58.776483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:273079ae477d6585219ffa4574a8aa34346d262fd16b6daa5fdb56678f4c2811","observation_id":"7bfd5b7e-726a-4d1c-8a0d-1c10414dc513","resolution":{"observed_at":"2026-05-13T02:57:09.430005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:10d220572439a90403e27c790213392f049cde10117ef02264a2bf6f89cabff1","observation_id":"e9480a13-e071-48a0-acd9-5af89844e208","resolution":{"observed_at":"2026-05-14T21:29:28.696436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.19018","last_updated":"2026-05-18T18:40:24Z","snapshot_observed_at":"2026-08-01T08:22:24.297762Z","submitted_at":"2026-05-18T18:40:24Z","title":"LoRA vs. Full Fine-Tuning: A Theoretical Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T12:14:11.947836Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.19018"},"observation_digest":"sha256:e49065f873e703212bfdd8c9d8c3ac3bc501d82743bd3c94c7cea157b308b44f","observation_id":"2517ff75-3a82-4aac-8bd5-25be0473d21a","resolution":{"observed_at":"2026-05-20T12:18:16.801931Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.20052","last_updated":"2026-05-20T02:26:28Z","snapshot_observed_at":"2026-08-01T18:53:42.021927Z","submitted_at":"2026-05-19T16:07:42Z","title":"PromptRad: Knowledge-Enhanced Multi-Label Prompt-Tuning for Low-Resource Radiology Report Labeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T05:41:17.997800Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.20052"},"observation_digest":"sha256:2d8b4e877150ee9baaadee07fc18c7716171183dc134e74f7fa74b728dfce045","observation_id":"ca35d6f6-a5e9-45e3-9454-965f879c84cf","resolution":{"observed_at":"2026-05-20T05:43:05.863325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.20052","last_updated":"2026-05-20T02:26:28Z","snapshot_observed_at":"2026-08-01T18:53:42.021927Z","submitted_at":"2026-05-19T16:07:42Z","title":"PromptRad: Knowledge-Enhanced Multi-Label Prompt-Tuning for Low-Resource Radiology Report Labeling","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T07:53:46.273508Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.20052"},"observation_digest":"sha256:a8f599d3fd445e04a2ca90cdd00f4588edb8e11d76fb4dc3c4a07f3f7e0488f8","observation_id":"f49a51fc-ea9f-4be6-a8c9-42960eecb63d","resolution":{"observed_at":"2026-05-21T07:54:02.637557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-06T17:53:39.851226Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:604a0b6de70620e779598639d7af4a80953cfca8fd5a6d3ceacf2322b6da9c9d","observation_id":"9dce5377-20ef-4699-b079-4fc60b94cadd","resolution":{"observed_at":"2026-06-29T13:23:28.023366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.31246","last_updated":"2026-05-29T12:46:15Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T12:46:15Z","title":"BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T21:52:23.150188Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.31246"},"observation_digest":"sha256:47f140c0821cdffc19fbe2dfc5a891af63c3d8d9f4280edec345065ec988d8db","observation_id":"9bb93867-19eb-442a-8a51-673fb8b042b9","resolution":{"observed_at":"2026-07-01T19:56:11.294800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.02100","last_updated":"2026-06-01T11:32:02Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T11:32:02Z","title":"PortBERT: Navigating the Depths of Portuguese Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T14:43:28.401687Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.02100"},"observation_digest":"sha256:f7cdb69b90a5660e7385cf61ea86b26596e52f0b6445ac7d20c5b000a9bd9c3e","observation_id":"b9ff0799-230a-4d9c-9b78-a41fa84c65d2","resolution":{"observed_at":"2026-07-01T23:06:20.221903Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.07082","last_updated":"2026-06-10T09:18:33Z","snapshot_observed_at":"2026-08-05T15:10:48.574545Z","submitted_at":"2026-06-05T09:20:15Z","title":"On the Geometry of On-Policy Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T22:47:04.213358Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.07082"},"observation_digest":"sha256:2ab1b73e74ca1357bb13bc5c072c29e0b6a5865de845d0276cde727fc047124f","observation_id":"801769d5-86c1-4dff-b51d-0461a5974d56","resolution":{"observed_at":"2026-07-02T16:27:08.862860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.07559","last_updated":"2026-07-18T19:19:00Z","snapshot_observed_at":"2026-08-02T13:16:35.534776Z","submitted_at":"2026-05-25T10:44:42Z","title":"Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T21:54:30.991573Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.07559"},"observation_digest":"sha256:68d55b0ef0c01b43e95ce8170ee6f12d0cde0d84ba7f04e434c722bc14b3c529","observation_id":"5e248862-10b4-4d88-96c3-58754aed301f","resolution":{"observed_at":"2026-06-29T22:04:00.576999Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-02T13:16:38.124570Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.07559","last_updated":"2026-07-18T19:19:00Z","snapshot_observed_at":"2026-08-02T13:16:35.534776Z","submitted_at":"2026-05-25T10:44:42Z","title":"Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T13:16:38.124570Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.07559"},"observation_digest":"sha256:fa4e39a3a4fb2c66a6399edd87797cfaba07373c2f8de4a2d5bd228f2a259b08","observation_id":"ebd6ee2f-ea30-48b4-850b-6e8ad4d48ac0","resolution":{"observed_at":"2026-08-02T13:16:38.124570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:8e92d5a3bda4bd3d44eeebef70c6cf3f223c5b1e74b07c9b96a14e036f34b958","observation_id":"fd0521bb-ffb5-495e-9e51-a482d1e2dc0f","resolution":{"observed_at":"2026-06-30T22:15:05.450842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.18521","last_updated":"2026-06-16T22:22:40Z","snapshot_observed_at":"2026-08-07T14:14:01.160036Z","submitted_at":"2026-06-16T22:22:40Z","title":"Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:02.938997Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.18521"},"observation_digest":"sha256:244a96a43b93d2f92f1c0c89ec95faae1d88e3219d82ceac9b76181071d9daa3","observation_id":"184ff01d-adbf-4fc1-a310-130609772a5f","resolution":{"observed_at":"2026-07-03T21:08:57.821995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.19638","last_updated":"2026-06-17T22:31:36Z","snapshot_observed_at":"2026-08-03T03:47:19.226788Z","submitted_at":"2026-06-17T22:31:36Z","title":"MiqraBERT: Regression-Based Sentence-BERT Finetuning for Biblical Hebrew Parallel Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:30:05.043803Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.19638"},"observation_digest":"sha256:59929bf9893015d0f005cc44fca8a212ed89dc6e145d2e3808fb87921ced35bb","observation_id":"e927e833-4491-4ed6-961a-358ea600a34d","resolution":{"observed_at":"2026-07-04T01:19:20.994944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.19638","last_updated":"2026-06-17T22:31:36Z","snapshot_observed_at":"2026-08-03T03:47:19.226788Z","submitted_at":"2026-06-17T22:31:36Z","title":"MiqraBERT: Regression-Based Sentence-BERT Finetuning for Biblical Hebrew Parallel Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:30:05.043803Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.19638"},"observation_digest":"sha256:acd3d43174699c33f67dea66dd640b3fe1468ad8c18542e2f48c2a9db796dcc4","observation_id":"461299ca-31ab-42f5-9b20-daf5450a4ce1","resolution":{"observed_at":"2026-06-26T20:49:57.860299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.19988","last_updated":"2026-06-18T09:28:30Z","snapshot_observed_at":"2026-07-06T23:55:10.536884Z","submitted_at":"2026-06-18T09:28:30Z","title":"Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T16:48:12.177090Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.19988"},"observation_digest":"sha256:4da3f7562fcfa326506838e6b93d706e4d00ba07b80cc50e7df89fee528dec07","observation_id":"014aceff-902a-4c32-b1a8-af77508d665f","resolution":{"observed_at":"2026-07-04T04:49:34.445786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.20536","last_updated":"2026-06-18T17:49:32Z","snapshot_observed_at":"2026-08-02T03:58:15.338048Z","submitted_at":"2026-06-18T17:49:32Z","title":"The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T17:42:21.628047Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.20536"},"observation_digest":"sha256:6411cdb54fc3051f951b4f17252873dfca19b75f3a5db1bc3ea10110bce4747e","observation_id":"4cef2d21-e320-4d4b-863c-71bb436ec705","resolution":{"observed_at":"2026-07-04T03:49:29.528251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.22606","last_updated":"2026-06-21T17:24:31Z","snapshot_observed_at":"2026-07-06T23:57:28.172988Z","submitted_at":"2026-06-21T17:24:31Z","title":"Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-06-26T10:18:29.700444Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.22606"},"observation_digest":"sha256:895baae14e489a998b75f4720bf6d544ced83a065e9d2e3a6260b42018f0655f","observation_id":"2be36366-81bd-4a57-acdb-4dbf56f663f0","resolution":{"observed_at":"2026-07-04T09:19:42.859218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.22917","last_updated":"2026-06-22T06:57:30Z","snapshot_observed_at":"2026-07-06T23:57:42.632111Z","submitted_at":"2026-06-22T06:57:30Z","title":"GRAIN: Group Aggregation via Min-Norm Objective","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-26T09:18:55.049767Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.22917"},"observation_digest":"sha256:b6f2814bd1a30178144e00b68280418a587e275aa0d592e76b31b95c3ed1123b","observation_id":"75c89c94-3105-427c-ab92-09316fecc380","resolution":{"observed_at":"2026-07-04T09:59:45.269882Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2606.29554","last_updated":"2026-06-28T18:44:08Z","snapshot_observed_at":"2026-07-07T00:03:31.715960Z","submitted_at":"2026-06-28T18:44:08Z","title":"Optimizer Memory Makes Shuffle Order a First-Order Source of Fine-Tuning Noise","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-30T07:15:56.974540Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2606.29554"},"observation_digest":"sha256:53eed5a6dc30b5bd32b771056fa9675c3b1cea96782fb696be1085dd50e1537d","observation_id":"8039ae6c-1868-4493-9144-5659599b240b","resolution":{"observed_at":"2026-06-30T07:24:21.865183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-01T08:36:23.469133Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-06T22:04:57.750051Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:23.469133Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:6309c2d6ff6bd0c1740db0afa6adbb64acad3163638130c2f8788edc56937993","observation_id":"3cfef4e6-f123-47ec-990d-3c71ffae3f54","resolution":{"observed_at":"2026-08-01T08:36:23.469133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-07-30T10:55:15.500484Z","title":"arXiv preprint arXiv:2002.06305 , year=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23837","last_updated":"2026-07-26T20:42:56Z","snapshot_observed_at":"2026-08-03T05:54:37.554482Z","submitted_at":"2026-07-26T20:42:56Z","title":"Latent-LoRA: Compact Latent-Space Adapters with Gradient-Free Routing for Continual Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-30T10:55:15.500484Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2607.23837"},"observation_digest":"sha256:3aa63b91cd6bd88824570cd7dc5c167aa2298cffabbb09c0a6e10ca63c6fb768","observation_id":"f0d39616-0efc-41c9-9614-13a0b18ab9e9","resolution":{"observed_at":"2026-07-30T10:55:15.500484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-06T18:22:28.042785Z","title":"Antske Fokkens, Marieke van Erp, Marten Postma, Ted Pedersen, Piek V ossen, and Nuno Freire","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.04714","last_updated":"2026-08-05T11:28:43Z","snapshot_observed_at":"2026-08-07T20:16:17.788251Z","submitted_at":"2026-08-05T11:28:43Z","title":"What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:22:28.042785Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2608.04714"},"observation_digest":"sha256:7610b2bd8d02efa80850ac02599d5535c9d8762a4fa649493bf6f2b4c3bad1d4","observation_id":"e787555d-0ada-4d70-89b4-998b2c209f89","resolution":{"observed_at":"2026-08-06T18:22:28.042785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2002.06305/citation-record","integrity":"/paper/2002.06305/integrity","json":"/paper/2002.06305/citation-record.json","paper":"/paper/2002.06305"},"outbound":[],"paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2002.06305."}