{"as_of":"2026-08-04T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b90c9b3236d1d705d2dddac223dd4a2d45cf516a64149de9db2727ef0bdd9cf","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:01:58.384077Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":129,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:57:54.208551Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T18:40:03.351817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"1907.10424","last_updated":"2019-07-22T15:57:00Z","snapshot_observed_at":"2026-07-06T08:09:51.382237Z","submitted_at":"2019-07-22T15:57:00Z","title":"Less (Data) Is More: Why Small Data Holds the Key to the Future of Artificial Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/1907.10424"},"observation_digest":"sha256:89b0524ec99f33dca56b9d279627d2031f50ae3329774f8cf50b1ef2fe69d33a","observation_id":"514dfd0f-5dc1-4381-b5de-c007a02cc76b","resolution":{"observed_at":"2026-05-24T17:59:46.427253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T05:37:55.083206Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/1910.10683"},"observation_digest":"sha256:4f4c02e8c6df7a859351d25a6e890f09acbc95d5ba4bcffc0374574b8d027843","observation_id":"975b707a-91b6-4193-9a76-4f9ce98be130","resolution":{"observed_at":"2026-05-12T05:37:55.598498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:38.045330Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2005.14165"},"observation_digest":"sha256:209ba32bbd109fcb77015e1276a71a39a684eef5a18cbc3c035486cd60815341","observation_id":"29a02755-1767-4cf5-a407-048449667f03","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T07:49:43.711653Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2010.14701"},"observation_digest":"sha256:92865265ede601539805e0e16182176f12a12715a346fa90fd0f4263bdbc0238","observation_id":"afaea3e1-f7ee-4178-bde2-cdce07c3c266","resolution":{"observed_at":"2026-05-13T07:49:43.798863Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-18T00:58:13.116663Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2102.01293"},"observation_digest":"sha256:5ff4691592b3fa58b6b8e6ec9a0753986c10f24527e8d6753319781475de8809","observation_id":"ac9a3666-f070-4603-b0f4-ff9b0f479dab","resolution":{"observed_at":"2026-05-18T00:58:13.565013Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-05-11T14:22:57.925354Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2112.00861"},"observation_digest":"sha256:06e4714f86060c484169c07b69a1aea97af4f8e797212bc7e88cb873225a3d0c","observation_id":"d379a640-d038-41c3-90a7-3907d63aa1a1","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2205.10487","last_updated":"2022-05-21T02:14:27Z","snapshot_observed_at":"2026-08-04T13:21:32.121470Z","submitted_at":"2022-05-21T02:14:27Z","title":"Scaling Laws and Interpretability of Learning from Repeated Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T15:52:40.335080Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2205.10487"},"observation_digest":"sha256:05e46e4e1ee0d850ac195051cd47229c9ecb5aab46523ad850e9aae941d788df","observation_id":"11e187b8-41b7-4536-960a-79afe7378292","resolution":{"observed_at":"2026-05-17T15:52:40.412536Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-05-10T15:42:47.274448Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2207.05221"},"observation_digest":"sha256:27a8e360a04abad67d3961bd2675910c609fbdd0d92b302e248ed6978aecbef9","observation_id":"d294308b-94d1-43ff-a05b-e589131172b9","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:7bcc698a98a67151d6fca5db8ba5661d88536cbb232a9e6273505203f61c886f","observation_id":"a502432f-8db1-48ee-b10c-840050cbd313","resolution":{"observed_at":"2026-05-15T01:44:22.742944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"reference_index":246,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:10.919818Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2211.05100"},"observation_digest":"sha256:1b8f025fa23d38c092d282e2b41d699c25b35d3c6cdbd947a46f175e665acdf6","observation_id":"85dc33cb-665a-40a5-ac42-11283a585205","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e895ba3d31b4aed3c38da1cbed301d2897f5a6307aa1e0b76071c86d079f1b82","observation_id":"fbbaf43a-42d7-42a1-9153-fcf769dc874e","resolution":{"observed_at":"2026-05-18T02:43:30.962598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:ff5ade952a16f4e4479004decc81a3ae4e782fffe82217026d3511cccbb33c6e","observation_id":"72030300-90e7-4570-9f06-1c94e000c6a4","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.148223Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2306.11644"},"observation_digest":"sha256:f65a51c7466374ee3a19ae975e34c74520f12158db20141d584d2d34b645844d","observation_id":"36da703d-5091-42f2-a390-bdc2c29fdda0","resolution":{"observed_at":"2026-05-13T04:44:03.215640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:1f954ec564274e52e5d1685f4d89d4c7a9921067d1fe572e9a165b0bcfc6bf22","observation_id":"d532fcba-a4c0-4c89-84ae-e6b6064386bc","resolution":{"observed_at":"2026-05-16T09:46:10.125756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"reference_index":161,"source":"arxiv_source","source_observed_at":"2026-05-11T06:08:05.550346Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2401.02954"},"observation_digest":"sha256:608be03e34ec85d3bb21ed491cc709f24c516ab50fed92998e729d5f3f246d00","observation_id":"1afb1963-6d01-4c40-9e51-17c15e5627aa","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2404.19756","last_updated":"2025-02-09T21:09:09Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:58:29Z","title":"KAN: Kolmogorov-Arnold Networks","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T23:42:03.773376Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2404.19756"},"observation_digest":"sha256:e5f77bd22e2fa0345130705bba0d6649b1ee5674c23bb6905b1b5c83c2c42315","observation_id":"6c7007f1-98ec-4ba4-9029-60d729e1ad82","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:70338b38aa64be1d305455ec881bd8330a146401cd305c5e377eb7db04a01f65","observation_id":"0213c23c-f541-4bf2-8572-4efa2179a368","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-01T15:05:23.324854Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-15T06:03:56.328012Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2405.07987"},"observation_digest":"sha256:aaab6a5c87f5f9939507d13be05a6eab54d28069063a2079db67b905c6be7d14","observation_id":"07ceb1de-df9f-48c9-9f11-2e067afe7054","resolution":{"observed_at":"2026-05-15T06:03:56.626639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:42:23.297389Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2407.21787"},"observation_digest":"sha256:ef005f6124b5f9547c6d41ebbd4c8dc541d28b023aef08434a652009718e9349","observation_id":"78da744d-cec9-4b0f-b7c1-f004df70c50c","resolution":{"observed_at":"2026-05-12T04:42:23.557841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:3ea43b811e7f6ff74c3c82bd8da502697e2042882b18dd69a1b276829ee26f4f","observation_id":"ce95105a-17a8-4e9e-ad4b-2b5c71de518a","resolution":{"observed_at":"2026-05-18T06:38:36.982834Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2502.05074","last_updated":"2025-11-10T21:45:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T16:45:40Z","title":"Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:04.110552Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.05074"},"observation_digest":"sha256:685b7e90612046ca3fb30513592b46041973b091ab27c2a8221a291ba289e9fa","observation_id":"25fd2a75-02de-4c00-b4c7-9aa8992d0a00","resolution":{"observed_at":"2026-05-23T04:17:30.976657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:e582d1f39ee9073a8785670a60786a2932928c90734bb71d22f66dd1d9fa988a","observation_id":"58e3fb3e-fadf-4442-90c2-2ea0e79218b3","resolution":{"observed_at":"2026-05-23T02:52:27.146660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T23:17:02.701393Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2504.14945"},"observation_digest":"sha256:e8eccfa2287575d2d368ef4c3fd7dabe1c2fb819a88f67b2f3e46cd03d39ae59","observation_id":"adc29fea-1a55-46be-9a34-b7f56bbbf9ee","resolution":{"observed_at":"2026-05-15T23:17:02.906539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2505.10465","last_updated":"2025-11-29T21:39:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-15T16:18:13Z","title":"Superposition Yields Robust Neural Scaling","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T14:38:44.789822Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.10465"},"observation_digest":"sha256:ed1c268047f949c26f3dd93d860793c499c5a34e73d2f4c05c4876bc2f88101b","observation_id":"d4a043e1-572b-4920-9a3b-ba5fbdaefb27","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-05-19T01:01:09.840919Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.00432"},"observation_digest":"sha256:5a7a13d01cae96d12b9b618afff4196e197525b3400d760f088cadb1e9fcecf9","observation_id":"8083e182-fe65-4345-a547-aa3306403c56","resolution":{"observed_at":"2026-05-19T01:01:10.419409Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2507.09001","last_updated":"2026-05-01T03:34:46Z","snapshot_observed_at":"2026-07-06T21:55:55.177927Z","submitted_at":"2025-07-11T20:08:07Z","title":"Surprisingly High Redundancy in Electronic Structure Data Across Materials Explained by Low Intrinsic Dimensionality","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T04:42:33.911146Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.09001"},"observation_digest":"sha256:472867f2dade1769792eee45e5d0e3ebcfecfe1f0b1975e3891bc8a8a2fd7a65","observation_id":"772f12f5-34c6-4773-8fca-892e6d1fccd4","resolution":{"observed_at":"2026-05-19T04:42:58.759277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-04T17:57:54.208551Z","title":"Hestness, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10367","last_updated":"2025-09-12T16:00:49Z","snapshot_observed_at":"2026-08-04T17:57:44.856181Z","submitted_at":"2025-09-12T16:00:49Z","title":"A Discrepancy-Based Perspective on Dataset Condensation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:54.208551Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2509.10367"},"observation_digest":"sha256:d353bcc20a0f3e09515e4c784aef0559a1a54e202e96a150a6e5a332b397877f","observation_id":"bb9dafa9-4a55-486a-b241-b37312b616ce","resolution":{"observed_at":"2026-08-04T17:57:54.208551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2509.24244","last_updated":"2026-05-11T07:55:31Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:36:55Z","title":"Model Merging Scaling Laws in Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:32:33.009367Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2509.24244"},"observation_digest":"sha256:ded61f84d8762cad2be695f8277eb775c9f6984eb7616a0d8223c2e7770ad227","observation_id":"64ab0d33-4195-499e-bdfe-98626d797736","resolution":{"observed_at":"2026-05-18T13:32:37.799231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-03T14:02:56.679860Z","title":"Deep learning scaling is predictable, empirically.arXiv preprint arXiv:1712.00409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22088","last_updated":"2026-06-10T15:31:41Z","snapshot_observed_at":"2026-08-04T20:26:36.323933Z","submitted_at":"2025-12-26T17:20:09Z","title":"Unifying Learning Dynamics and Generalization in Transformers Scaling Law","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:02:56.679860Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2512.22088"},"observation_digest":"sha256:23f39e289876d57af6f5eca1f83642056ce45094fde28041353d96d2b60f79a4","observation_id":"6696dc73-88cb-462e-aa30-f1ec82c47d6f","resolution":{"observed_at":"2026-08-03T14:02:56.679860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-03T05:01:11.827070Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03685","last_updated":"2026-05-31T19:36:07Z","snapshot_observed_at":"2026-08-03T05:01:07.831427Z","submitted_at":"2026-02-03T16:06:18Z","title":"Universal One-third Time Scaling in Learning Peaked Distributions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:01:11.827070Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.03685"},"observation_digest":"sha256:290f6311e41f681c6edfcd8bd14d135f10bb4ac806d4e142156916128caed283","observation_id":"bf4aa6c9-727d-4de7-b3ba-2a85f700aacc","resolution":{"observed_at":"2026-08-03T05:01:11.827070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-03T04:14:14.322728Z","title":", Narang, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.05725","last_updated":"2026-06-03T16:40:26Z","snapshot_observed_at":"2026-08-03T04:14:09.367178Z","submitted_at":"2026-02-05T14:49:40Z","title":"Muon in Associative Memory Learning: Training Dynamics and Scaling Laws","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:14.322728Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.05725"},"observation_digest":"sha256:58cd3f2aa7d3fa9fcefba0a1de6a88d6a4055cfb95113384be9ad24e6c1b8b2e","observation_id":"2b45cd0b-65bb-4b8a-9e5e-9266e167ff81","resolution":{"observed_at":"2026-08-03T04:14:14.322728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-03T04:07:45.647284Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05970","last_updated":"2026-05-31T19:48:07Z","snapshot_observed_at":"2026-08-03T12:50:18.766511Z","submitted_at":"2026-02-05T18:22:41Z","title":"Inverse Depth Scaling From Most Layers Being Similar","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:07:45.647284Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.05970"},"observation_digest":"sha256:d7b9cf56ae3037229b9527caf3a858e1b22ac897566cc9900fba0e3ffd8f24bc","observation_id":"a8efea24-d597-4757-ac1d-8af7720cb3dd","resolution":{"observed_at":"2026-08-03T04:07:45.647284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-02T23:16:52.194717Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.14330","last_updated":"2026-06-28T23:31:17Z","snapshot_observed_at":"2026-08-02T23:16:51.223824Z","submitted_at":"2026-02-15T22:54:39Z","title":"Pattern recognition with superconducting wirelet neurons","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:52.194717Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.14330"},"observation_digest":"sha256:1580138295cf34eeeb0f6d40fcca2299cc3f9546e42dcda181846c66cec4df30","observation_id":"540779b0-5a33-4f39-ac23-964bda1c0db2","resolution":{"observed_at":"2026-08-02T23:16:52.194717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-02T22:58:06.427823Z","title":"Deep learning scaling is predictable, empiri- cally.arXiv preprint arXiv:1712.00409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15253","last_updated":"2026-06-05T22:59:16Z","snapshot_observed_at":"2026-08-04T01:51:13.364057Z","submitted_at":"2026-02-16T23:20:58Z","title":"Scaling Laws for Masked-Reconstruction Transformers on Single-Cell Transcriptomics","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T22:58:06.427823Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.15253"},"observation_digest":"sha256:096b2e96c306163cd09735c77f92dc813d7543765e86e0190812910b085ecb83","observation_id":"6bb20e09-2fc5-493e-97a8-ff44738d7dd5","resolution":{"observed_at":"2026-08-02T22:58:06.427823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-02T22:58:13.339623Z","title":"Deep learning scaling is predictable, empirically.arXiv preprint arXiv:1712.00409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15327","last_updated":"2026-06-06T22:17:18Z","snapshot_observed_at":"2026-08-02T22:58:08.817247Z","submitted_at":"2026-02-17T03:13:51Z","title":"Prescriptive Scaling Reveals the Evolution of Language Model Capabilities","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T22:58:13.339623Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2602.15327"},"observation_digest":"sha256:0dd3a5d8aa1e40751793fd45529f3016f10fc79edd5e0bb2554a57f292ae8862","observation_id":"36e78b39-37fb-458e-af19-4eb73d35962e","resolution":{"observed_at":"2026-08-02T22:58:13.339623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2603.05719","last_updated":"2026-04-17T17:16:41Z","snapshot_observed_at":"2026-07-06T22:48:04.438669Z","submitted_at":"2026-03-05T22:19:55Z","title":"Unsupervised domain adaptation for radioisotope identification in gamma spectroscopy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T15:51:58.680289Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2603.05719"},"observation_digest":"sha256:166a6df057c97f44ffef0c3ff7b09f1edd0a40ad7a5c0e84545dafc16eb99fcf","observation_id":"11495edf-692f-4478-bc79-2a10f07492b8","resolution":{"observed_at":"2026-05-15T15:56:13.282694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.05068","last_updated":"2026-04-06T18:14:53Z","snapshot_observed_at":"2026-07-06T22:53:55.926521Z","submitted_at":"2026-04-06T18:14:53Z","title":"Towards Scaling Law Analysis For Spatiotemporal Weather Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:05.921123Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.05068"},"observation_digest":"sha256:3396dedc705d053319ef3017b5ffadc59c1426108516ac8a5ef1797b94d7bc45","observation_id":"2f8479ea-bbd3-48f2-8c98-5851850b27e5","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.12647","last_updated":"2026-04-14T12:17:50Z","snapshot_observed_at":"2026-08-02T14:44:28.912344Z","submitted_at":"2026-04-14T12:17:50Z","title":"Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:27:42.172289Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.12647"},"observation_digest":"sha256:10d05d0a86edd7d7cd18a83836d9f56a519e895e447d10422fb9bd98f836a853","observation_id":"41b9fcb2-61ee-429d-87a9-a52a10e95a8e","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.13275","last_updated":"2026-04-14T20:12:05Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T20:12:05Z","title":"Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:18:33.458143Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.13275"},"observation_digest":"sha256:c54e2540f225dfd4c4a0b38561b37d7632b11a3b85b1e4dc5efed4cc97e76f44","observation_id":"d1721d61-b85b-4b1e-8d41-a57465123ab0","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.14886","last_updated":"2026-04-16T11:24:29Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T11:24:29Z","title":"Cooperate to Compete: Strategic Data Generation and Incentivization Framework for Coopetitive Cross-Silo Federated Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T11:34:37.094078Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.14886"},"observation_digest":"sha256:698797034321ab93a981e60273e8105b9fa4bc1de6de2febeacc419b14d35a3d","observation_id":"82d57020-0a31-412e-a87f-0979de1a0bbc","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.16842","last_updated":"2026-04-18T05:24:35Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T05:24:35Z","title":"Singularity Formation: Synergy in Theoretical, Numerical and Machine Learning Approaches","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-10T07:13:10.140500Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.16842"},"observation_digest":"sha256:30f37807d4143c2f815199252f6b2abee945a3756d0f6f9a4a8414b8aabc7c3e","observation_id":"0560f094-5f7b-40a2-8085-a2134900a099","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.22938","last_updated":"2026-06-30T23:32:43Z","snapshot_observed_at":"2026-07-06T23:09:14.698490Z","submitted_at":"2026-04-24T18:24:19Z","title":"Large language model-enabled automated data extraction for concrete materials informatics","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:46.387553Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.22938"},"observation_digest":"sha256:b4d2d501df71ae701a5fe959b1a669cd04dc2c3207881425fa26ef9f6ab00bda","observation_id":"52a6bc6f-4d41-484f-bc74-a3a0a2c05521","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.22938","last_updated":"2026-06-30T23:32:43Z","snapshot_observed_at":"2026-07-06T23:09:14.698490Z","submitted_at":"2026-04-24T18:24:19Z","title":"Large language model-enabled automated data extraction for concrete materials informatics","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-04T16:51:19.852113Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.22938"},"observation_digest":"sha256:e191e80c3b8866534ebbd331123bdf833bbc7d6788a2bd1682a3ae3104d31f35","observation_id":"4e484b28-db55-4e61-9fe6-b46c348b469f","resolution":{"observed_at":"2026-07-04T16:59:57.578122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T11:49:49.787123Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:40da2789328b7884378b558457a4440055cc9d4118d8fdff75eba4e9bc95b72d","observation_id":"829e7795-a063-49e4-bfd9-206e5041c13c","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-12T18:26:05.728364Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T18:26:05.728364Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:bfe0e30e97835c237c65ec22ea59320cd227c2b984bbb81c17583ea74351531b","observation_id":"520ab415-b00e-493f-89e9-14d03588f34e","resolution":{"observed_at":"2026-07-12T18:26:05.728364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.23933","last_updated":"2026-04-27T01:17:43Z","snapshot_observed_at":"2026-07-06T23:10:02.659384Z","submitted_at":"2026-04-27T01:17:43Z","title":"Robust and Clinically Reliable EEG Biomarkers: A Cross Population Framework for Generalizable Parkinson's Disease Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:45:21.450891Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.23933"},"observation_digest":"sha256:d265e840c820b0a9a5f2b513a2d89ecb5626c9c8539a79fcfffa9093e47bcf92","observation_id":"f2443624-3f3d-40f9-91d7-e2b8b367731e","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.24037","last_updated":"2026-06-22T01:13:01Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:43:42Z","title":"A Limit Theory of Foundation Models: A Mathematical Approach to Understanding Emergent Intelligence and Scaling Laws","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T07:27:21.118156Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.24037"},"observation_digest":"sha256:2cd3a78d50d9c7ad1931207dcc24863ec914ecdfb6d104ca3c1daee834f6804a","observation_id":"a85e909b-9471-4f81-ab46-7b9e25127628","resolution":{"observed_at":"2026-05-13T07:27:28.906951Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.24037","last_updated":"2026-06-22T01:13:01Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T04:43:42Z","title":"A Limit Theory of Foundation Models: A Mathematical Approach to Understanding Emergent Intelligence and Scaling Laws","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T09:03:59.522516Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.24037"},"observation_digest":"sha256:e119626a4d2e48e7993acc56b434dda66d2a56c3096580ea2208e52ae0b49fe1","observation_id":"8dac1038-e830-4bbf-b39f-07f7cf679641","resolution":{"observed_at":"2026-07-01T09:05:36.332691Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2604.27911","last_updated":"2026-04-30T14:18:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T14:18:56Z","title":"Physical Foundation Models: Fixed hardware implementations of large-scale neural networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T06:21:44.094430Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2604.27911"},"observation_digest":"sha256:36c14822e8d3c81e6d1667eb9ff09d387c02d5b70a808f762e171adc51230dc4","observation_id":"3c66cd38-9f1b-4090-9e5d-83b247197d55","resolution":{"observed_at":"2026-05-12T10:26:28.477938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.01468","last_updated":"2026-05-02T14:35:49Z","snapshot_observed_at":"2026-07-06T23:14:43.034336Z","submitted_at":"2026-05-02T14:35:49Z","title":"Decision Boundary-aware Generation for Long-tailed Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T14:53:15.311563Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.01468"},"observation_digest":"sha256:79f3b98be0ab231df8b6b1b73f89cc8b29a278e18007c31936a4ded1dbdf3373","observation_id":"6fce5b58-8c2c-481a-bae7-1e61d972db0d","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.02364","last_updated":"2026-05-04T09:07:54Z","snapshot_observed_at":"2026-07-06T23:15:27.816549Z","submitted_at":"2026-05-04T09:07:54Z","title":"InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T18:45:52.380042Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.02364"},"observation_digest":"sha256:532fb83434c78f450ef7f759bbc12ce6870f4fb6084f0f43c7fac40977ca9b89","observation_id":"c150fcac-23b5-4f74-a24b-2a7647603359","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:db32d700156f188ea65c59adc1209ed8ab047ca95f42a5ee29a8c02f8e4f7443","observation_id":"165c0509-e00b-44de-be81-834ec1460257","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.06116","last_updated":"2026-05-07T12:26:56Z","snapshot_observed_at":"2026-08-02T23:05:12.532363Z","submitted_at":"2026-05-07T12:26:56Z","title":"Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T10:29:23.538806Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.06116"},"observation_digest":"sha256:cd10e1e0852719f61f6e8dc6ab8eb0efc040984edd47e0566c12a991ff05a7cd","observation_id":"031c8463-f0ec-4d2b-b7ea-419ad54a5d1f","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.07795","last_updated":"2026-05-08T14:32:41Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:32:41Z","title":"Scalable Distributed Stochastic Optimization via Bidirectional Compression: Beyond Pessimistic Limits","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-11T02:52:53.588595Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.07795"},"observation_digest":"sha256:6b4b5b30971d6ac3d6955baa1fb872e30dd4c6a99ab0fc6661ec5b2a9bb022db","observation_id":"82e12882-bc2d-4e10-a675-2a7128d5c1f2","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.08297","last_updated":"2026-05-08T11:07:44Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T11:07:44Z","title":"A Qualitative Test-Risk Mechanism for Scaling Behavior in Normalized Residual Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:22.676352Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.08297"},"observation_digest":"sha256:3c4dde579bf084d4f1d9d00174bca7e7bcb47e401be6692f19f368113c994d2f","observation_id":"8cb21c14-9748-4418-b8de-dba0b889ff7d","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:ab3bf951d339f7baf5106b38e48f50985af5ed96c4b26c1f91619c2a649868c3","observation_id":"3df36130-a39a-48f4-b6ea-1dc018dc38ee","resolution":{"observed_at":"2026-05-12T08:06:31.409011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:e9806948e402fb88883186a0a78db46b8dc4802a8fc9b7b5ef4bc5ba173d1fb5","observation_id":"e664e7ad-0335-430e-a058-e5a285555ac9","resolution":{"observed_at":"2026-05-19T18:07:42.387601Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.08871","last_updated":"2026-05-09T10:46:59Z","snapshot_observed_at":"2026-07-31T15:53:03.039634Z","submitted_at":"2026-05-09T10:46:59Z","title":"Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-12T01:51:20.003552Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.08871"},"observation_digest":"sha256:519b10de10da1564d7c1974360653fb2e1c5ec5cc433f6cdb9a0bad242f0ea16","observation_id":"b8dbc3b2-0f8f-4809-add9-ddd05c36fa59","resolution":{"observed_at":"2026-05-12T07:51:31.175969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.09189","last_updated":"2026-05-09T22:07:01Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:07:01Z","title":"Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T02:58:26.656927Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.09189"},"observation_digest":"sha256:811bfea330a0c5454f14dc757cf51b4e637684d3f8c25eb4a83939f0139b7da0","observation_id":"8e95f885-9bd0-4117-95b5-764e89e58e46","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.10395","last_updated":"2026-05-11T11:39:03Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:39:03Z","title":"Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T02:55:52.782619Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.10395"},"observation_digest":"sha256:7f24fdf061cbc16c991be75b996cd52487ee68e63052efd5cf5f694fbf997b83","observation_id":"3f222f57-ec12-453c-9ec3-ff04553a285e","resolution":{"observed_at":"2026-05-12T04:01:58.491474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.12049","last_updated":"2026-05-12T12:29:33Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:29:33Z","title":"Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T06:29:20.810421Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.12049"},"observation_digest":"sha256:c27e3b33f5ddf44d1640b833f0004b50e0153f0305264a02c759f76273795b47","observation_id":"f38cb8ca-ebae-4e5d-89ba-b02b4c643a0c","resolution":{"observed_at":"2026-05-13T06:32:24.082918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.14659","last_updated":"2026-05-14T10:12:49Z","snapshot_observed_at":"2026-08-02T09:32:52.715749Z","submitted_at":"2026-05-14T10:12:49Z","title":"Slower Generalization, Faster Memorization: A Sweet Spot in Algorithmic Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:25:40.727207Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.14659"},"observation_digest":"sha256:6594374e7ad3cad9880996575e1542822cfdd2b6b277dda05054950ea7e86bb7","observation_id":"7cb85df0-070b-4f5b-add0-770ac35d736b","resolution":{"observed_at":"2026-06-30T21:35:04.970162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.15551","last_updated":"2026-05-15T02:44:25Z","snapshot_observed_at":"2026-08-03T14:14:32.753126Z","submitted_at":"2026-05-15T02:44:25Z","title":"Characterizing Learning in Deep Neural Networks using Tractable Algorithmic Complexity Analysis","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-20T20:24:16.373261Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.15551"},"observation_digest":"sha256:6598e43adce282b46b1f28d9c201542c836ddba6e2f02bc791853b0223423254","observation_id":"68564a24-aae0-46b0-a757-94df026f7e98","resolution":{"observed_at":"2026-05-20T20:28:59.960691Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.17152","last_updated":"2026-05-16T20:56:15Z","snapshot_observed_at":"2026-08-02T18:07:50.795904Z","submitted_at":"2026-05-16T20:56:15Z","title":"Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-20T14:33:36.100966Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.17152"},"observation_digest":"sha256:d57b42a6db6a247c58c5071a95daa7b94f36799a413edfa7d5532c8c169ac738","observation_id":"46d5656f-07af-4a21-abcd-779bcc67bb83","resolution":{"observed_at":"2026-05-20T14:38:21.806829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.17340","last_updated":"2026-05-19T02:26:50Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:19:22Z","title":"Olivia: Harmonizing Time Series Foundation Models with Power Spectral Density","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T14:42:04.841976Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.17340"},"observation_digest":"sha256:10bee0586f4607934deb36fd6127c3b655936c00c952f9d06a3292d8d20e23f8","observation_id":"356c6d3b-f1fa-404b-964d-020437857784","resolution":{"observed_at":"2026-05-20T14:43:22.371238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.17671","last_updated":"2026-05-17T22:04:01Z","snapshot_observed_at":"2026-07-06T23:28:41.111402Z","submitted_at":"2026-05-17T22:04:01Z","title":"PEIRA: Learning Predictive Encoders through Inter-View Regressor Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-20T13:41:52.182460Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.17671"},"observation_digest":"sha256:3f82c509fc4819b75a82a3edf0dda0a3c3258b49ebd531d810ebce8b946380bf","observation_id":"704ab82a-45ce-445b-b4f5-c79d8a04e102","resolution":{"observed_at":"2026-05-20T13:43:19.518941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.18174","last_updated":"2026-05-18T10:18:02Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:18:02Z","title":"Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-20T13:08:52.912250Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.18174"},"observation_digest":"sha256:d672633e0b9094e95d5568c791d150f9de77051f92420bd77fb802a83468c183","observation_id":"9fe30ceb-27a9-41e6-982a-ad350b84bcb7","resolution":{"observed_at":"2026-05-20T13:13:18.514552Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.20866","last_updated":"2026-05-20T08:01:45Z","snapshot_observed_at":"2026-08-02T02:54:50.828651Z","submitted_at":"2026-05-20T08:01:45Z","title":"LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-21T05:49:28.713982Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.20866"},"observation_digest":"sha256:d9565b08553efba441af78532ac2f967d9e242f99a2439aba1dd25bdc549db9b","observation_id":"87e0eda3-9207-4e48-9fd9-e0acfe77da82","resolution":{"observed_at":"2026-05-21T05:49:40.708125Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.22341","last_updated":"2026-05-21T11:26:32Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:26:32Z","title":"A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T07:07:01.822626Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.22341"},"observation_digest":"sha256:44174f8f0461a6e206bbf7e35c5691c3e74b517d4335ca1c583efdb5365f1d06","observation_id":"791f7813-9fa2-4129-b91f-e29a6dd6373c","resolution":{"observed_at":"2026-05-22T07:11:13.091001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.23198","last_updated":"2026-05-22T03:29:12Z","snapshot_observed_at":"2026-07-06T23:33:24.215365Z","submitted_at":"2026-05-22T03:29:12Z","title":"Label-Efficient Dataset Pruning via Semi-Supervised Pseudo-Labeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-25T05:24:53.628214Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.23198"},"observation_digest":"sha256:bda6f549e005674a36a443f195579abeb453fbde6b19411191f4def5f98f9192","observation_id":"ddad9a06-dd4d-4325-bca3-e264c0ee9aaf","resolution":{"observed_at":"2026-05-25T05:25:23.280458Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.23591","last_updated":"2026-05-22T13:00:52Z","snapshot_observed_at":"2026-08-02T07:23:00.263762Z","submitted_at":"2026-05-22T13:00:52Z","title":"Asymmetric Scaling Laws from Sparse Features","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-25T03:16:34.488732Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.23591"},"observation_digest":"sha256:d82ccd390ea04a1f20744556bd223baf2c11744575e47e4b3a9aa14015653d23","observation_id":"59ee4be3-8aad-4101-a4e3-794d1c4f806d","resolution":{"observed_at":"2026-05-25T03:20:16.887648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.24025","last_updated":"2026-05-20T13:39:48Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-20T13:39:48Z","title":"Towards Large Model Feature Coding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T17:16:38.347066Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.24025"},"observation_digest":"sha256:082d6537b0898b9fc8e8cc5d4e21ba35f8d483eddb17d541301055c90161d38e","observation_id":"52c8f627-b25f-426e-9903-70dc71916e25","resolution":{"observed_at":"2026-07-01T15:05:48.535211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.24316","last_updated":"2026-06-25T06:26:55Z","snapshot_observed_at":"2026-08-01T14:56:15.713802Z","submitted_at":"2026-05-23T00:48:36Z","title":"From One-Pass SGD to Data Reuse: Mini-Batch Scaling Laws in Sketched Linear Regression","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:09:52.456340Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.24316"},"observation_digest":"sha256:a4efd6683b43043f9825109c496085de8899cb258d7ad1165adcbe711436dd4f","observation_id":"e00ae9f4-fc3a-4207-985a-9793b8af5a13","resolution":{"observed_at":"2026-06-30T14:14:45.607625Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.25916","last_updated":"2026-05-25T14:51:07Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T14:51:07Z","title":"Joint Optimization of Training and Inference in Federated Edge Learning via Constrained Multi-Objective Deep Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:33:46.615995Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.25916"},"observation_digest":"sha256:ea0c4600843060c046bd5da25b5f5874a66fb54187a39fd961b934f4e19471e3","observation_id":"ad00f3ac-9217-4d07-a195-fd23563c8215","resolution":{"observed_at":"2026-06-29T22:34:01.280352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.26248","last_updated":"2026-05-25T18:15:27Z","snapshot_observed_at":"2026-07-06T23:36:06.135765Z","submitted_at":"2026-05-25T18:15:27Z","title":"Unified Neural Scaling Laws","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:43.393302Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.26248"},"observation_digest":"sha256:d81f3136190b286922d8aad1c78c2843ce5a26519d8c1dc886d18c26f8f82f46","observation_id":"2b27d33d-9f65-4844-8fcf-11af0c013ebe","resolution":{"observed_at":"2026-06-29T23:44:03.365102Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.27486","last_updated":"2026-05-26T15:00:31Z","snapshot_observed_at":"2026-07-06T23:37:12.630650Z","submitted_at":"2026-05-26T15:00:31Z","title":"Federated Learning for Multivariate Time Series Anomaly Detection in Industrial Automation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:44:54.996171Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.27486"},"observation_digest":"sha256:8b8a6b105756c36d53cc3b163fea3d896ece9aab5fefaeb424a5e3371b3b59cc","observation_id":"6e004a90-ce7a-4963-b885-9166ba3c6e0c","resolution":{"observed_at":"2026-06-29T18:53:51.714983Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.27989","last_updated":"2026-05-27T05:23:45Z","snapshot_observed_at":"2026-08-03T00:57:30.869718Z","submitted_at":"2026-05-27T05:23:45Z","title":"Law of Neural Interaction: Depth-Width Shape, Interaction Efficiency, and Generalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T14:14:25.876963Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.27989"},"observation_digest":"sha256:fb9d818c23aa28d6e92359f14c7d72b8c10fe3b2a778f0b5a7a8fc73e4396caf","observation_id":"6158b416-e604-4222-985c-1deff389251f","resolution":{"observed_at":"2026-06-29T14:23:31.009301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.28238","last_updated":"2026-05-27T09:53:59Z","snapshot_observed_at":"2026-07-06T23:37:50.157617Z","submitted_at":"2026-05-27T09:53:59Z","title":"Approximate Label Symmetries Improve Data Scaling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T09:47:06.818853Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.28238"},"observation_digest":"sha256:a239019c76494ba7e11abe759f3247e0ab756e24b85b61a0bf38783ab8d076d8","observation_id":"6a3d2ac3-9c70-4bc5-8fbf-2ec5a83316f3","resolution":{"observed_at":"2026-06-29T09:53:17.520745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.29448","last_updated":"2026-07-18T01:59:39Z","snapshot_observed_at":"2026-08-02T12:58:30.693921Z","submitted_at":"2026-05-28T06:40:29Z","title":"How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:33:05.952601Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.29448"},"observation_digest":"sha256:67dbd6842a09ff2f2c29ef9584db2cbf6efbb8b39b6d7f3ecb23354f01d95861","observation_id":"1ab3e127-411c-46c2-a7b7-9fc878b04e2d","resolution":{"observed_at":"2026-06-29T08:33:14.820030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-02T12:58:43.123742Z","title":"et al.Deep Learning Scaling Is Predictable, Empirically","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29448","last_updated":"2026-07-18T01:59:39Z","snapshot_observed_at":"2026-08-02T12:58:30.693921Z","submitted_at":"2026-05-28T06:40:29Z","title":"How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:58:43.123742Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.29448"},"observation_digest":"sha256:46fe5f2098950d3cb40263ee0d146af60d49847baef94c631353d7a9d8ef4a2e","observation_id":"57b08f31-ed44-4eab-a8f3-530e6b7a8496","resolution":{"observed_at":"2026-08-02T12:58:43.123742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2605.29548","last_updated":"2026-06-01T17:29:35Z","snapshot_observed_at":"2026-08-02T17:41:19.598860Z","submitted_at":"2026-05-28T08:02:11Z","title":"Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T08:39:14.327838Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2605.29548"},"observation_digest":"sha256:00ac9c29bded25cf89131fcfe8c3dd2ac62262501f612a74fdc674a8796bc93a","observation_id":"0230f171-025f-4dcd-ac16-47ea85be6c41","resolution":{"observed_at":"2026-06-29T08:43:15.163161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.00047","last_updated":"2026-05-01T08:30:27Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-01T08:30:27Z","title":"Comprehensive AI governance requires addressing non-model gains","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T08:11:23.860723Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.00047"},"observation_digest":"sha256:f576917c8fd4602ab61b27b43b83f198f59a5c9a85e1d2906801d67e78f7392a","observation_id":"d9a9fc05-5fc0-4cc8-886b-15fa5a2215ac","resolution":{"observed_at":"2026-07-01T08:15:31.701270Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.01302","last_updated":"2026-05-31T15:44:57Z","snapshot_observed_at":"2026-08-03T15:53:51.708818Z","submitted_at":"2026-05-31T15:44:57Z","title":"Structure and Scale in Simplicial Sequence Modelling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:00.475488Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.01302"},"observation_digest":"sha256:cbbaa92ccc38931b0cf87bc9c841a8432c28bf3f1e4f16ab2411869a3e22cadb","observation_id":"ba3582e0-4b4c-4025-8186-392ae46786d0","resolution":{"observed_at":"2026-07-01T21:16:14.977410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.02008","last_updated":"2026-06-01T10:02:29Z","snapshot_observed_at":"2026-08-02T21:19:35.926247Z","submitted_at":"2026-06-01T10:02:29Z","title":"Provable Data Scaling Law for Meta Learning via Complexity Minimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T12:59:45.023339Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.02008"},"observation_digest":"sha256:5e23f593bbf9c715f587507bcf5196a0cc3c5503d71c05cf328232b6f040635d","observation_id":"18deef41-c00b-46bc-85f9-e5da4520fcf3","resolution":{"observed_at":"2026-07-02T00:56:25.409863Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.03990","last_updated":"2026-06-02T17:59:52Z","snapshot_observed_at":"2026-08-02T14:35:23.417132Z","submitted_at":"2026-06-02T17:59:52Z","title":"Neuron Populations Exhibit Divergent Selectivity with Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T10:49:48.975614Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.03990"},"observation_digest":"sha256:38af3128f2c9e4022924714effbd1e67d674c80a7bf68d0960e17f53fefb11ff","observation_id":"de7ca9b2-a486-4235-8a8d-d4c4ee0c473c","resolution":{"observed_at":"2026-07-02T02:36:26.800235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.04409","last_updated":"2026-06-06T02:49:10Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:36:34Z","title":"An Empirical Study of Data Scale, Model Complexity, and Input Modalities in Visual Generalization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:57.103343Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.04409"},"observation_digest":"sha256:6b5c653a5dec2a37a3a467b4a401e0503ab9b6c16b00f65d02cd8b12e36643af","observation_id":"b7fb159a-cef6-4470-969c-145ecea63775","resolution":{"observed_at":"2026-07-02T07:36:44.815533Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.05029","last_updated":"2026-06-03T15:57:42Z","snapshot_observed_at":"2026-08-01T16:51:47.025025Z","submitted_at":"2026-06-03T15:57:42Z","title":"Validity Threats for Foundation Model Research","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:41.653304Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.05029"},"observation_digest":"sha256:9bad5825376e56cfda7e534663ddd2706c18771b59d49842e1d33c9287fab816","observation_id":"ea3771a4-7df7-4592-89a6-0c86f13d79e3","resolution":{"observed_at":"2026-07-02T07:36:44.941240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.06533","last_updated":"2026-06-03T17:58:14Z","snapshot_observed_at":"2026-08-02T17:01:27.433772Z","submitted_at":"2026-06-03T17:58:14Z","title":"Position: Don't Just \"Fix it in Post\": A Science of AI Must Study Training Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.06533"},"observation_digest":"sha256:91ada5aa15936319c2f96252e5ba019e0f7051269237e9fcafe4dd2e90b63d00","observation_id":"605bf3ab-f043-49b7-abb7-2c1137cd6e17","resolution":{"observed_at":"2026-06-28T06:31:42.744297Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.06725","last_updated":"2026-06-04T21:21:33Z","snapshot_observed_at":"2026-07-06T23:46:28.942186Z","submitted_at":"2026-06-04T21:21:33Z","title":"Compute-Optimal Network Design for Echocardiography Myocardial Segmentation and Perfusion Quantification using Neural Scaling Laws","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T23:02:38.001509Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.06725"},"observation_digest":"sha256:eadde2d8271c224ef132a3db522d9a1fa356136fe0b43e48b352673016a80667","observation_id":"e228318b-2dad-4d25-933d-26ddc1b0404e","resolution":{"observed_at":"2026-07-02T16:07:08.704149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.06888","last_updated":"2026-06-09T06:01:51Z","snapshot_observed_at":"2026-08-01T16:12:34.477524Z","submitted_at":"2026-06-05T04:10:09Z","title":"Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T22:24:01.067388Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.06888"},"observation_digest":"sha256:84a28c9fd25ba65aab31cd277d141b9c656b8e3d2d71b4a6fe3b443f7843a1fc","observation_id":"8a335536-f5a0-457c-9b43-d3a6869e596e","resolution":{"observed_at":"2026-07-02T16:47:09.790468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.07616","last_updated":"2026-05-29T20:55:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T20:55:15Z","title":"Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:48:20.193699Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.07616"},"observation_digest":"sha256:4ba2308a55a6475a44616e8fd10dbfd1ad8c9ad188f7632e208d2c7416d189c9","observation_id":"9f2c653b-cffb-4c1f-824e-4cc948bd7fe5","resolution":{"observed_at":"2026-06-28T22:52:45.609046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.08155","last_updated":"2026-06-06T13:10:45Z","snapshot_observed_at":"2026-07-06T23:47:43.942733Z","submitted_at":"2026-06-06T13:10:45Z","title":"Have I Solved This Before? Retrieving Similar Segmentation Problems for Evolutionary Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T20:24:54.690043Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.08155"},"observation_digest":"sha256:5b299530777d009bad6f98ee765ca2e10ebd3ae1e3b0e2d8f49e64ecd375290e","observation_id":"e0cee13c-0311-43df-b850-06240e98c6b5","resolution":{"observed_at":"2026-07-02T20:27:22.457790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.08574","last_updated":"2026-06-07T11:11:51Z","snapshot_observed_at":"2026-08-03T13:39:16.935988Z","submitted_at":"2026-06-07T11:11:51Z","title":"OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-27T18:26:32.883834Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.08574"},"observation_digest":"sha256:c7741974976abdf10ceb92c22aa4d67e3f6a4953aae31ef59cdab0281518286b","observation_id":"f53a3d2a-b4c6-4534-be26-9f9b40ee311f","resolution":{"observed_at":"2026-07-02T23:07:27.210482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.10582","last_updated":"2026-06-09T08:45:58Z","snapshot_observed_at":"2026-08-04T07:59:58.567607Z","submitted_at":"2026-06-09T08:45:58Z","title":"Drawing with Strangers: Population Scaling Drives Zero-Shot Mutual Intelligibility in Emergent Sketching","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T14:14:27.967249Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.10582"},"observation_digest":"sha256:94afa926bb6ae53f710c4e7e843dc1025d26d7bde8f16d5696a09bd830277254","observation_id":"bb4770d0-09ba-4c29-a688-074775a7f671","resolution":{"observed_at":"2026-07-03T04:07:36.683882Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.10595","last_updated":"2026-06-09T09:00:04Z","snapshot_observed_at":"2026-07-31T10:41:08.733048Z","submitted_at":"2026-06-09T09:00:04Z","title":"From Data Heterogeneity to Convergence: A Data-Centric Review of Federated Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T12:42:08.487008Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.10595"},"observation_digest":"sha256:1a894fb0597d176b98a19b6dc80dc8a1497dfb576c182ee80e1b590c0e0783c8","observation_id":"09c96467-1ff5-4c24-a256-487ed702f93b","resolution":{"observed_at":"2026-07-03T06:17:42.608174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.10905","last_updated":"2026-06-09T14:13:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T14:13:58Z","title":"Beyond Model Size: Probing the Gaps in Visual in-Context Learning by Training a Tiny Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:55.497762Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.10905"},"observation_digest":"sha256:abf9ac5b03bcecb7abbb236e34280402c6f5d61e77743a06e8be471bdc2d0297","observation_id":"6815be82-34e3-42ec-b72a-094a359ddf16","resolution":{"observed_at":"2026-07-03T04:57:38.420754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:a72aec3edca575ab0f443d82981567d29a96a8f3c8750216044d73d31d3f30ba","observation_id":"caea6735-0e6b-4355-a78d-f953ed053c25","resolution":{"observed_at":"2026-07-02T22:17:25.622451Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.18147","last_updated":"2026-06-16T16:45:56Z","snapshot_observed_at":"2026-08-03T00:46:36.791384Z","submitted_at":"2026-06-16T16:45:56Z","title":"WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T00:53:11.223341Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.18147"},"observation_digest":"sha256:f82e088c8db9d3c048c9ec8243fac709d7b2671b99e015ba0e4a2680991ff3f2","observation_id":"6e904cc8-7eea-4417-8532-a3698178e562","resolution":{"observed_at":"2026-07-03T21:08:58.481292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.19781","last_updated":"2026-06-28T01:34:44Z","snapshot_observed_at":"2026-08-04T19:27:12.027281Z","submitted_at":"2026-06-18T04:32:06Z","title":"Towards Engineering Scaling Laws with Pretraining Data Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T15:33:32.257098Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.19781"},"observation_digest":"sha256:71c84729a7b54b2d3a82fa900b059ce539d1948e939a4feddbe408be79992a4c","observation_id":"0cd704da-d6ce-449d-a7cf-136bfe868f7e","resolution":{"observed_at":"2026-07-04T05:49:36.769974Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2606.19781","last_updated":"2026-06-28T01:34:44Z","snapshot_observed_at":"2026-08-04T19:27:12.027281Z","submitted_at":"2026-06-18T04:32:06Z","title":"Towards Engineering Scaling Laws with Pretraining Data Composition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T11:28:08.860046Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2606.19781"},"observation_digest":"sha256:82607c93c71bdba5e3e305c1abeed4e1fd5b272a96699f19b516d3b9a42d9e43","observation_id":"ee9c0249-34ad-4d6f-a209-e519c411f254","resolution":{"observed_at":"2026-06-30T11:34:38.091410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1712.00409/citation-record","integrity":"/paper/1712.00409/integrity","json":"/paper/1712.00409/citation-record.json","paper":"/paper/1712.00409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1508.04395","last_updated":"2016-03-14T23:07:20Z","snapshot_observed_at":"2026-07-06T04:27:00.684723Z","submitted_at":"2015-08-18T17:40:00Z","title":"End-to-End Attention-based Large Vocabulary Speech Recognition","version":2},"cited_work":{"arxiv_id":"1508.04395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1508.04395","snapshot_observed_at":"2026-07-04T20:53:25.624389Z","title":"Bahdanau, J","venue":null,"work_id":"36320dbd-97b4-4ab8-b756-25d528a74bbf","year":null},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1508.04395","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:cd4baa5ff493b1e7e04d15803b5f4d3f3f972e8c106d2983f2ac129fa66af1e6","observation_id":"bf18a820-1ae0-447b-a1d8-332dd53fa7c7","resolution":{"observed_at":"2026-07-04T20:53:25.624389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07413","last_updated":"2017-07-24T06:05:21Z","snapshot_observed_at":"2026-08-03T15:17:55.338595Z","submitted_at":"2017-07-24T06:05:21Z","title":"Exploring Neural Transducers for End-to-End Speech Recognition","version":1},"cited_work":{"arxiv_id":"1707.07413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1707.07413","snapshot_observed_at":"2026-07-04T22:04:57.417555Z","title":"Battenberg, J","venue":null,"work_id":"922107df-9b22-47ea-bbf7-4525f623163a","year":null},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1707.07413","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:b962a49d4fa883e520b2625e5c9ff1aa69d0405c674e8b1cfc800c804020cc73","observation_id":"9fda7e7a-d0c6-4290-ac24-b6ac8002a6e3","resolution":{"observed_at":"2026-07-04T22:04:57.417555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-03T10:46:49.960100Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":"1312.3005","doi":null,"metadata_source":"pith","pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-07-04T13:59:52.553578Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","venue":"cs.CL","work_id":"9d2758a8-0899-488e-adf7-065babd89bba","year":2013},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:4d519cea6690957d138cafd1e4fb8893fc4328afc5dd225be226b0dc3b1c42c3","observation_id":"7aaf8160-68f9-4cd2-ae3b-b4f1a55e16c1","resolution":{"observed_at":"2026-05-12T04:01:58.413562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":"1412.5567","doi":"10.48550/arxiv.1412.5567","metadata_source":"pith","pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep Speech: Scaling up end-to-end speech recognition","venue":"cs.CL","work_id":"eb57b6c8-18a7-4e51-b90a-2add68d4ee9e","year":2014},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:44c11de179abcecddab9625e267f98c422a0934e0ea6867ee69e88420f3b0010","observation_id":"d98064fe-8d22-4197-85d0-03e411a22c8b","resolution":{"observed_at":"2026-05-12T04:01:58.419869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-07-06T04:45:24.152472Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:a4db9568b96c0f6bd63c76b96691d84e5ef8fe006fca89a472b96b7526ba1b2f","observation_id":"835b84aa-055a-4b4c-b593-a13df1cfdb61","resolution":{"observed_at":"2026-05-12T04:01:58.425887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05468","last_updated":"2023-08-22T03:04:22Z","snapshot_observed_at":"2026-07-06T06:04:20.308068Z","submitted_at":"2017-10-16T02:21:24Z","title":"Generalization in Deep Learning","version":9},"cited_work":{"arxiv_id":"1710.05468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1710.05468","snapshot_observed_at":"2026-06-29T18:53:51.993717Z","title":"Generalization in deep learning","venue":null,"work_id":"11fac83e-41c3-4b49-94b9-5f1eb865c192","year":2022},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1710.05468","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:fad053b3a0c5b3eeae2a679ff150d4e47ea43634be8e2721a63509aee147e025","observation_id":"239b867f-c54c-4da3-a889-6cac4893ad3b","resolution":{"observed_at":"2026-05-12T04:01:58.434075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0575","last_updated":"2015-01-30T01:23:59Z","snapshot_observed_at":"2026-07-06T03:53:12.119259Z","submitted_at":"2014-09-01T22:29:38Z","title":"ImageNet Large Scale Visual Recognition Challenge","version":3},"cited_work":{"arxiv_id":"1409.0575","doi":"10.48550/arxiv.1409.0575","metadata_source":"pith","pith_arxiv_id":"1409.0575","snapshot_observed_at":"2026-07-10T11:37:03.192414Z","title":"ImageNet Large Scale Visual Recognition Challenge","venue":"cs.CV","work_id":"2276495b-628b-4018-ae1b-0c6a96ec8a7c","year":2014},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1409.0575","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:924fdc651b14134a99a01cb03fa7f5949aa248e3393c0b9fbdec6e075ef9b163","observation_id":"fb365ce3-49a3-4acf-9850-77048cc937eb","resolution":{"observed_at":"2026-05-12T04:01:58.443038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":"1508.07909","doi":"10.48550/arxiv.1508.07909","metadata_source":"pith","pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":"cs.CL","work_id":"b540b77d-96cd-4550-9c11-d02686beb7b1","year":2015},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:96925de3d555a9188a31c6ace3e6e751f1b6982e23a62c2a1738bdeb505ec7b1","observation_id":"c370ae8d-0db9-4d69-aeee-b45eaefc356e","resolution":{"observed_at":"2026-05-12T15:15:20.428834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.02891","last_updated":"2016-06-27T23:02:24Z","snapshot_observed_at":"2026-07-06T04:59:21.486215Z","submitted_at":"2016-06-09T10:06:28Z","title":"Edinburgh Neural Machine Translation Systems for WMT 16","version":2},"cited_work":{"arxiv_id":"1606.02891","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.02891","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edinburgh Neural Machine Translation Systems for WMT 16","venue":"cs.CL","work_id":"6012fb7f-9e0a-4e56-83be-0404afff90b2","year":2016},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1606.02891","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:d8ac25b5abafea48cba650f5d122494ecd16b2bbca0506f2f50fc817f2f1df89","observation_id":"ccf6a9c0-a5de-43c5-91fb-afb1479124bb","resolution":{"observed_at":"2026-05-12T04:01:58.459625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06451","last_updated":"2018-02-14T19:42:20Z","snapshot_observed_at":"2026-07-06T06:04:45.729921Z","submitted_at":"2017-10-17T18:08:04Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","version":3},"cited_work":{"arxiv_id":"1710.06451","doi":"10.48550/arxiv.1710.06451","metadata_source":"pith","pith_arxiv_id":"1710.06451","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","venue":"cs.LG","work_id":"0d0de3bb-2df6-4f6d-b6dc-8294ed38aeb2","year":2017},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1710.06451","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:91d4787a4368ace784eaea10b9581c1959f078fe557bf133cd446d5595a7516b","observation_id":"23ada63c-faa9-4b8f-9627-7aefb3e5cf3b","resolution":{"observed_at":"2026-05-12T04:01:58.466561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:56.137503+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:56.137503+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":"1611.03530","doi":"10.48550/arxiv.1611.03530","metadata_source":"pith","pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Understanding deep learning requires rethinking generalization","venue":"cs.LG","work_id":"b260f96a-16f6-4936-8f3b-440917a19b34","year":2016},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:2d86ff1e643902e163f6b9cdaca5a193205367225d45d51fabacb9a085a5d3c7","observation_id":"d68aa1ef-37da-4caa-ab5e-d2aa7be59453","resolution":{"observed_at":"2026-05-13T11:56:40.372790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similar to word language models, we use normalized cross-entropy loss:− 1 N ∑ ilnpwi, wherepwi is the model’s predicted probability of seeing theith token","venue":null,"work_id":"e7996090-c172-4bf5-b18e-3dfbd9dbd0da","year":2006},"citing_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:58.384077Z"},"links":{"citing_paper":"/paper/1712.00409"},"observation_digest":"sha256:1ee31fac5a4ca1d9eeae318ac562fe2717fe3519cca8b0102528716fb41a0e1c","observation_id":"71ffe2b0-2603-430e-be97-480fd12640b2","resolution":{"observed_at":"2026-05-12T04:01:58.489519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 100 inbound Pith citation observations for arXiv:1712.00409."}