{"as_of":"2026-08-13T02:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87268e7b6958cec038ca71ebda1e9ffd395ce4fd960bb0e14d1f5bbfbe3b709a","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:07:17.187777Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18700/citation-record","integrity":"/paper/2411.18700/integrity","json":"/paper/2411.18700/citation-record.json","paper":"/paper/2411.18700"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T11:07:17.072102Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.072102Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:4861d386b613b9bf13218dac312b1c8455759caccd58b2b82eae70e940d7049e","observation_id":"8e94b6cc-9e36-4656-b103-5f0a93eb967b","resolution":{"observed_at":"2026-08-12T11:07:17.072102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-08-12T20:25:18.372785Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-08-12T11:07:17.077285Z","title":"Bert rediscovers the classical nlp pipeline,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.077285Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:8e12b8f4a4a68dde7d01af005090cf2c4be7f8d3d1f57064e4dd2dbb7eec0c9a","observation_id":"0c78e031-6c87-441f-bcb1-f6f298f0ad23","resolution":{"observed_at":"2026-08-12T11:07:17.077285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T11:07:17.081467Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.081467Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:78c7f277356ad59e785a66e75203d6b9533827f1ad841da61f77c07c65157eee","observation_id":"b64c5ac2-0d07-4d4f-8f8b-1ebb53944b65","resolution":{"observed_at":"2026-08-12T11:07:17.081467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T11:07:17.085994Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.085994Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:5ea35ecfaddb0f227306af7b209ce03fbec22a23819112dca4ae7a9223728a4c","observation_id":"14598270-c0ff-4c62-ac3d-440bb049dfb9","resolution":{"observed_at":"2026-08-12T11:07:17.085994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T11:07:17.090479Z","title":"Training compute-optimal large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.090479Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:236a0a0e57ef13ea82dda7170c7f85936c9ac25ebba89f89f7a099f67200b555","observation_id":"12439348-02dc-434e-ac1b-0217059f06b4","resolution":{"observed_at":"2026-08-12T11:07:17.090479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T11:07:17.094732Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.094732Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:421cf08d1681aea0d6d7c7037226c1d9347ec957e0ec43ab2dbadbd9f5d27e1e","observation_id":"980ea5dc-d5f2-4381-a8f7-06924a65c315","resolution":{"observed_at":"2026-08-12T11:07:17.094732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.099131Z","title":"A fast learning algorithm for deep belief nets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.099131Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:249d8d402ad64fc89a35d32102062957c4502650378c9b39e2d713e99b4241fe","observation_id":"25ee6e12-78f2-4a44-9998-5e19b622a658","resolution":{"observed_at":"2026-08-12T11:07:17.099131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.519239Z","title":"Greedy layer- wise training of deep networks,","venue":null,"work_id":"cc98f4ec-a328-4516-8b60-db90a2ef0879","year":2006},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.103345Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:81d575c20b7cfd7745036e092a8c96d94b702f0d5c6f5223d05fa51d71c1c92d","observation_id":"d8ab18b5-2a3a-4326-a982-14b1dbc99b3d","resolution":{"observed_at":"2026-08-12T11:07:17.523820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.505966Z","title":"The cascade-correlation learning architec- ture,","venue":null,"work_id":"e17291b6-b31c-4df0-aa0a-1cd32ad1d329","year":1989},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.107182Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:48cc961000a9e382801b03e673f2a7d97f4ee5f50a9c44bafdf8730203ad5a1f","observation_id":"c8871e9c-a191-41c6-bfd5-3736c3830568","resolution":{"observed_at":"2026-08-12T11:07:17.510236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-12T11:07:17.110794Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.110794Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:09cc7e3766e10337072bf7ca480cac62e27b0d3e9ac2dd67b989bd9e860ddf98","observation_id":"ee8b7273-9829-42aa-aa6e-efd1c33d98ab","resolution":{"observed_at":"2026-08-12T11:07:17.110794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.493073Z","title":"Analyzing hidden representations in end- to-end automatic speech recognition systems,","venue":null,"work_id":"8d6ddcc1-7a3d-4ef0-8a52-b3bb28c7e601","year":2017},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.114888Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:753f665c8d0725cffbcbabd747648d937963882a17d0e31f83c3819f0e20a3c3","observation_id":"ac1514ad-4586-4dcf-b5a2-75d08f926f6e","resolution":{"observed_at":"2026-08-12T11:07:17.496896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01380","last_updated":"2019-09-03T18:06:03Z","snapshot_observed_at":"2026-08-10T07:59:37.227895Z","submitted_at":"2019-09-03T18:06:03Z","title":"The Bottom-up Evolution of Representations in the Transformer: A Study with Machine Translation and Language Modeling Objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01380","snapshot_observed_at":"2026-08-12T11:07:17.118607Z","title":"The bottom-up evolution of representations in the transformer: A study with machine translation and language modeling objectives,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.118607Z"},"links":{"cited_paper":"/paper/1909.01380","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:a90f119994576cf5e8a649c9468113085520f3c7468f2951ef14e870adab36e4","observation_id":"def03a05-a250-46df-94d8-c585e739b61d","resolution":{"observed_at":"2026-08-12T11:07:17.118607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-12T11:07:17.122588Z","title":"Transformer feed-forward layers are key-value memories,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.122588Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:c0cbc4f9b50b61aed54d3d4bbf72409603326f70692b17d02fa71ee0edcb0297","observation_id":"35a86151-da4d-4fd4-a6ed-57636614eb5d","resolution":{"observed_at":"2026-08-12T11:07:17.122588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.481228Z","title":"Svcca: Singular vector canonical correlation analysis for deep learning dynamics and interpretability,","venue":null,"work_id":"1080b650-9c48-4d65-adfd-ac6c4301d726","year":2017},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.126445Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:76f16c7a3d98c5a264c94f80be933ec898bdc9a02b7180c0e372d0915a771e5a","observation_id":"dc3fc014-5cb3-4fef-9662-7f08d269cbe8","resolution":{"observed_at":"2026-08-12T11:07:17.485310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.468370Z","title":"Visualizing and understanding convolutional networks,","venue":null,"work_id":"3c6eb39c-20d7-4581-badc-70694e253a72","year":2014},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.129855Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:75ac816d43356d500f9b61adc0eabc2061852b221cdb5bd10dc2507ed63cc5f8","observation_id":"254cd807-f22d-46a5-b661-d8cd9626cad5","resolution":{"observed_at":"2026-08-12T11:07:17.472343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T11:07:17.133462Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.133462Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:5a881ac392968ee585cb2dcf420dbc7a4722ea97e2cc0f7f1cd48ebf202d0ff2","observation_id":"fe957c28-c9de-4056-bd4b-9c6c96da2ad2","resolution":{"observed_at":"2026-08-12T11:07:17.133462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.454849Z","title":"Why does unsuper- vised pre-training help deep learning?","venue":null,"work_id":"66836f23-5930-469a-a60a-e38528736db6","year":2010},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.137562Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:de21dea7233e84ee2b94b4ef998e1c31eb523619c854433844689bafc33031e8","observation_id":"08b23097-01bd-4b1a-8f60-41a3e2c3e273","resolution":{"observed_at":"2026-08-12T11:07:17.459738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-12T11:07:17.141100Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.141100Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:90aec1e4d8c5f917d1678091c1140a74ce4fe071844a23b900c513c1e1ca7929","observation_id":"53a07be4-1a81-4739-ad62-02493786a540","resolution":{"observed_at":"2026-08-12T11:07:17.141100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T11:07:17.145022Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.145022Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:93f80c47d518dfd0273e9eba8303a73a8815d3762cb00f1569e155eba9daace7","observation_id":"8b543ff2-8fd8-4520-affc-87eec956b3e2","resolution":{"observed_at":"2026-08-12T11:07:17.145022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-12T11:07:17.148936Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.148936Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:257dc1118f5ecf4541be5d803ab96a9bf1d8c97086df7e560f2f18efe05df34e","observation_id":"b3b32f80-6923-4e83-a35f-758e6b4c2edc","resolution":{"observed_at":"2026-08-12T11:07:17.148936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-12T22:43:22.928789Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-12T11:07:17.152917Z","title":"Universal language model fine-tuning for text classification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.152917Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:98b185493fe7678599a1aecbc218fd0e480a2e8d9732b8beafa629049fb8b4d2","observation_id":"04acfd1d-844b-4814-b545-67c71f54d203","resolution":{"observed_at":"2026-08-12T11:07:17.152917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-13T00:19:22.520801Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-12T11:07:17.157078Z","title":"Progressive neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.157078Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:c7eaf6f74e534e0d465f0d136c31d85cd42f2918509a7fd38acf120a8a8cf24d","observation_id":"b95f1d8f-9be0-4227-913a-e7951f3a350c","resolution":{"observed_at":"2026-08-12T11:07:17.157078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6211","last_updated":"2015-03-04T01:43:31Z","snapshot_observed_at":"2026-08-12T14:32:45.094113Z","submitted_at":"2013-12-21T06:31:41Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6211","snapshot_observed_at":"2026-08-12T11:07:17.161309Z","title":"An empirical investigation of catastrophic forgetting in gradient-based neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.161309Z"},"links":{"cited_paper":"/paper/1312.6211","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:4b7455e6c054904e307ffb38e4ca8e78c8d210ebd59278b7dff6475898424970","observation_id":"d2c69e01-9f59-46fd-94e0-52803e39fe34","resolution":{"observed_at":"2026-08-12T11:07:17.161309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.166435Z","title":"How transferable are features in deep neural networks?","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.166435Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:a2d894e43ae5e78b785f1ae75cabd5031b4bc8229a437633211fb85b22f01241","observation_id":"bd30d1d6-9297-42ec-b819-f5ceff22f5c8","resolution":{"observed_at":"2026-08-12T11:07:17.166435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-12T11:07:17.170606Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.170606Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:ce5b2f7898e68a28d86b14e0148592dafe74a7c2bc306df16222e85803ef0ded","observation_id":"f5ea9ea4-19ef-46ed-9985-cfc563d25274","resolution":{"observed_at":"2026-08-12T11:07:17.170606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.435401Z","title":"Fineweb- edu,","venue":null,"work_id":"bba398ed-47fd-47f1-abfd-96bfec1b1a2b","year":2024},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.174737Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:a7ba5a86f437f0b712cb61e3e775395c6b437cb6e5505be41bf0261db9bb53e8","observation_id":"a86c7fe5-b006-41f8-a950-cbd05c080d48","resolution":{"observed_at":"2026-08-12T11:07:17.439285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T11:07:17.178636Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.178636Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:ac589465eab3836b3032e61f2576b15f0c4e4c835f98912df5d7c69724d92452","observation_id":"46459acf-7dc4-488a-8c36-842f54d2ee83","resolution":{"observed_at":"2026-08-12T11:07:17.178636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-12T11:07:17.183757Z","title":"Hel- laswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.183757Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:2c84ab2900de2f57bc6ec590790e666d864f741dff841aaae8b10d59c525d955","observation_id":"87a60cc8-8eb3-4df5-8417-d28617c884ca","resolution":{"observed_at":"2026-08-12T11:07:17.183757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:07:17.421582Z","title":"Deep feedforward net- works,","venue":null,"work_id":"6d7a6c8f-6490-4845-8b3e-8012c082d31b","year":2016},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.187777Z"},"links":{"citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:8e9c51bee83c7203cd64652e10333ba88be3f994edfae8f22d5d0971fd254f7b","observation_id":"bc76df30-b020-4876-a902-00052a076e06","resolution":{"observed_at":"2026-08-12T11:07:17.426541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T20:25:55.492723Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2411.18700."}