{"as_of":"2026-08-09T07:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bfc976e7ebe794903084e922996153e70bde448489da593d19371f743a4d8b7","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:56.233445Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:38:12.882914Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T05:41:02.181700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2505.24788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Houjun Liu, John Bauer, and Christopher D","venue":null,"work_id":"986161a5-aa9a-4065-97e1-e2d883f427fe","year":2026},"citing_paper":{"arxiv_id":"2604.17465","last_updated":"2026-04-30T22:17:02Z","snapshot_observed_at":"2026-08-02T19:54:22.380858Z","submitted_at":"2026-04-19T14:30:13Z","title":"Language models recognize dropout and Gaussian noise applied to their activations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:38:12.882914Z"},"links":{"cited_paper":"/paper/2505.24788","citing_paper":"/paper/2604.17465"},"observation_digest":"sha256:06d496855ef30bc3813b6464dc961d81542e846d0200d08eb91634b32d86c8c9","observation_id":"09c0af84-9f63-4978-80fb-afcb9cce6080","resolution":{"observed_at":"2026-05-10T05:41:02.183113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24788/citation-record","integrity":"/paper/2505.24788/integrity","json":"/paper/2505.24788/citation-record.json","paper":"/paper/2505.24788"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.226689Z","title":"InProceedings of the 2021 Confer- ence on Empirical Methods in Natural Language Pro- cessing, pages 5484–5495, Online and Punta Cana, Dominican Republic","venue":null,"work_id":"88508c15-c3dc-46b0-a018-f1542e89a914","year":2021},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.922866Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:701338f20d69cb3f21ca7ca8fe28e7675572a84fa6e5ed5d3d7708c3a9dc2397","observation_id":"ec892921-0533-4864-8a44-1ec55ded0f7b","resolution":{"observed_at":"2026-08-07T12:18:58.303745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.830195Z","title":"Association for Computational Linguistics","venue":null,"work_id":"d39c99bc-dc1b-4212-a7ca-e1168edcc3ec","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.307375Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:27548ebc6d94a1942660c70e17318368e1f182e1b538205a8eca86c337a5f3bd","observation_id":"d0fc1467-7b46-4b9d-8151-76d043095499","resolution":{"observed_at":"2026-08-07T12:18:57.917281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.462857Z","title":null,"venue":null,"work_id":"763587b3-eda9-4c99-9035-5c57cce994a2","year":2018},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.555633Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:d80a3ca5c88997179e8a5066800aa70a373cebe3800b78561ed542311dfb90cd","observation_id":"8b9aed26-2221-4d6c-8020-ac3c1db84b21","resolution":{"observed_at":"2026-08-07T12:18:57.569992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.296539Z","title":"InProceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 38–45, Online","venue":null,"work_id":"925e63ce-e98a-428f-b9a1-f38969336d07","year":2020},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.697998Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:47f5e46766a44aee2c97b2d1efc2abbc2ca9ed9eb1e04e3fcc37eba38e4603f9","observation_id":"9c845021-90ce-4769-b02e-54015936c838","resolution":{"observed_at":"2026-08-07T12:18:57.370618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.474957Z","title":"An adapted version of the official evaluation script was used to obtain the dev-slice results reported in this work","venue":null,"work_id":"5939adcf-f210-48eb-977b-049925c6c1db","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.183766Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:6130a69822b2ff063912aa512d2e96c447b1e9f8d4d8069e3477a5de3c6f6e72","observation_id":"60612f92-7e0d-45af-a219-1073cb261708","resolution":{"observed_at":"2026-08-07T12:18:56.523414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.087875Z","title":"When MLP dropout is used, p= 0.1","venue":null,"work_id":"644ff5b6-3643-4585-83aa-87fe27f64847","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.880575Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:ed72ac97d8e3fc7e651c3a5fe61ccafc107ae4493ebf727798d30c2975cff9e4","observation_id":"97e2a51e-cf1b-4b21-9de7-94b0fdac0da8","resolution":{"observed_at":"2026-08-07T12:18:57.207353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.835795Z","title":"Batching was done sequentially with the Pytorch Data Loader, sequence lengths are capped at 512 tokens","venue":null,"work_id":"eb46b9aa-c593-448b-b88e-11acef89a49f","year":2024},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.962071Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:a75009e35f011dc3c20d26dc494a1bb89e09c38f4c7addf9dfce25d4bebc0d26","observation_id":"61ab845e-e8a5-4776-80d5-d0e8cf75666c","resolution":{"observed_at":"2026-08-07T12:18:56.970449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.613494Z","title":"Optimization was donewith regulariza- tionusing AdamW (Loshchilov and Hutter,","venue":null,"work_id":"a20d4ea0-5a48-4ed3-b948-90258bd3fb31","year":2023},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.060676Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:f110331abc181e7b65e5b1a577ce823889ee9dbfaf4dad11f38aef9e2e4d2f86","observation_id":"20f42294-0e67-46a4-8297-ab6a97aa1076","resolution":{"observed_at":"2026-08-07T12:18:56.712805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:56.358021Z","title":"Batch size was set to 128, and dropout rate was set to 0.15 regardless of whether pretrain- ing the BERT model used dropout consistent with previous approaches","venue":null,"work_id":"c10854e4-8f74-42b6-8e8a-17c11f04654c","year":2023},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:56.233445Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:3a1a59d83ccec8f384ff32db337f6098aa029cd23f644ce46235d0d2e83b75a1","observation_id":"6d2db1f3-db5b-493c-9e77-02120fb5abc2","resolution":{"observed_at":"2026-08-07T12:18:56.414228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-07-06T02:51:07.275676Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-07T12:18:55.233415Z","title":"Geoffrey E Hinton","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.233415Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:db548f3378eb09783c26e61bd635d32d6b52738ace1c477c40c1273669b7ad04","observation_id":"c64bc1a1-f446-49a1-8444-2caa456e0456","resolution":{"observed_at":"2026-08-07T12:18:55.233415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:57.646097Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":"3859167a-2352-4747-9193-dc704829c760","year":1929},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.402456Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:0ff6ec623b083ba55ac32b4fad08beb111055474e02fb10b64336208a8f38913","observation_id":"24b0913e-3420-446b-9874-bdd1cad2b9f2","resolution":{"observed_at":"2026-08-07T12:18:57.722046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.030097Z","title":"InProceedings of the 8th Workshop on Cognitive Modeling and Com- putational Linguistics (CMCL 2018), pages 10–18, Salt Lake City, Utah","venue":null,"work_id":"7979f18b-b30e-439c-86a2-4b8e2fbfd9a8","year":2018},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.139696Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:48e3e0211ef1a3ee89dae59a90c3a3ade25a9b98dd9fb7dab7007f24433df24a","observation_id":"8daa68c7-a906-4998-9fb2-58914a0172b7","resolution":{"observed_at":"2026-08-07T12:18:58.117199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.417597Z","title":null,"venue":null,"work_id":"08a0e9af-e041-4d38-8ecf-c79d277bd822","year":2019},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.555900Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:ab994a7229350d0e8cb640bf4ced41260b4b4eef7873737c841a50e8937cc2a5","observation_id":"a843f7c7-d1b9-4eec-8491-b4946b423fa7","resolution":{"observed_at":"2026-08-07T12:18:58.481051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T12:18:54.703706Z","title":"Mor Geva, Roei Schuster, Jonathan Berant, and Omer Levy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.703706Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:631c7bf319ebe93b3f2d425957e60113475773404691c0f6e5c3e6d217f37c3f","observation_id":"856c6ebb-6a4b-4186-ae65-14f8d09836ee","resolution":{"observed_at":"2026-08-07T12:18:54.703706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:58.551249Z","title":"InPro- ceedings of the 2021 Conference on Empirical Meth- ods in Natural Language Processing, pages 6491– 6506, Online and Punta Cana, Dominican Republic","venue":null,"work_id":"48b2be60-f0a8-47ac-9f40-b4e18e3b77d7","year":2021},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:54.415114Z"},"links":{"citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:607af98786d36b199db188b970b7cf38d21d23d75ccc5a54779b5433c2080eba","observation_id":"5d8ec641-5d65-4c91-a58c-9eddb65b716e","resolution":{"observed_at":"2026-08-07T12:18:58.666912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:18:55.499541Z","title":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Ł ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.499541Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:18007007f19bbc59adbcf5262dbb43e99157e27cdce67457769be9be5a0e99e8","observation_id":"3fe71e64-6957-4a44-bb46-2f501760d989","resolution":{"observed_at":"2026-08-07T12:18:55.499541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-07-06T17:55:44.838732Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-07T12:18:55.792408Z","title":"A Motivating the Studying of Dropout Through Knowledge Storage The central claim of Hinton et al","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:55.792408Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2505.24788"},"observation_digest":"sha256:15fd7098f1fd4dc757ec74264d2e92fa359c5afc8ebca26fb00c92460c13bff1","observation_id":"3f795873-d19c-46f8-9103-0ee8f35cf793","resolution":{"observed_at":"2026-08-07T12:18:55.792408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24788","last_updated":"2025-05-30T16:48:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:11:15.878396Z","submitted_at":"2025-05-30T16:48:38Z","title":"Drop Dropout on Single-Epoch Language Model Pretraining"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2505.24788."}