{"as_of":"2026-08-20T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5af00a3e4c6105a4f1384ee9e18da9d7074ced1ded5e2a557b81c8e61702050c","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:27:49.499597Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12700/citation-record","integrity":"/paper/2504.12700/integrity","json":"/paper/2504.12700/citation-record.json","paper":"/paper/2504.12700"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-18T12:23:06.967499Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-16T12:27:49.389192Z","title":"Grokking: Generalization beyond overfitting on small algorithmic datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.389192Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:c77a8c282d7119c0d09a2c1ab6c8310b0fff67252af5e4404e2f5ad9a5d104ea","observation_id":"9e80c18b-605e-46bb-a8a2-a19a44eb19c1","resolution":{"observed_at":"2026-08-16T12:27:49.389192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01117","last_updated":"2023-03-23T13:42:27Z","snapshot_observed_at":"2026-08-19T22:36:28.346094Z","submitted_at":"2022-10-03T17:58:04Z","title":"Omnigrok: Grokking Beyond Algorithmic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01117","snapshot_observed_at":"2026-08-16T12:27:49.394756Z","title":"Omnigrok: Grokking beyond algorithmic data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.394756Z"},"links":{"cited_paper":"/paper/2210.01117","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:3eeb96533eb352b2683f65e21f7935937262dddbc742b849d023e6430b2dd523","observation_id":"243b8f4d-f8e5-49df-93c4-6a44c9ce3193","resolution":{"observed_at":"2026-08-16T12:27:49.394756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02541","last_updated":"2023-10-04T02:50:34Z","snapshot_observed_at":"2026-08-18T17:35:32.794175Z","submitted_at":"2023-10-04T02:50:34Z","title":"Benign Overfitting and Grokking in ReLU Networks for XOR Cluster Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02541","snapshot_observed_at":"2026-08-16T12:27:49.400092Z","title":"Benign overfitting and grokking in relu networks for xor cluster data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.400092Z"},"links":{"cited_paper":"/paper/2310.02541","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:5292c115afcd1441e1054152e0db4b48d1ec1418fcaab834de07147a65b097ea","observation_id":"4f79a466-9aac-49cd-8814-524576b7e37f","resolution":{"observed_at":"2026-08-16T12:27:49.400092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15555","last_updated":"2024-06-06T18:33:15Z","snapshot_observed_at":"2026-08-16T14:15:48.967034Z","submitted_at":"2024-02-23T18:59:31Z","title":"Deep Networks Always Grok and Here is Why","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15555","snapshot_observed_at":"2026-08-16T12:27:49.405956Z","title":"Deep networks always grok and here is why,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.405956Z"},"links":{"cited_paper":"/paper/2402.15555","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:dec9b9ad3b9b63cec4ed7606a5b63a4125d4cc7cab704fe6b05d625897d66c9e","observation_id":"62bcf852-774c-4319-b882-f04b73193402","resolution":{"observed_at":"2026-08-16T12:27:49.405956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02390","last_updated":"2023-09-05T17:00:24Z","snapshot_observed_at":"2026-08-16T15:03:06.920972Z","submitted_at":"2023-09-05T17:00:24Z","title":"Explaining grokking through circuit efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02390","snapshot_observed_at":"2026-08-16T12:27:49.411603Z","title":"Explaining grokking through circuit efficiency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.411603Z"},"links":{"cited_paper":"/paper/2309.02390","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:5554c8c79772831a47cae236152623d7db8481737aa08cbe4b01f0df7097e956","observation_id":"68fddc4c-0d10-44b5-a1b5-afc480e7716f","resolution":{"observed_at":"2026-08-16T12:27:49.411603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.905748Z","title":"Grokking and the Geometry of Circuit Formation,","venue":null,"work_id":"7c5b442e-d29d-4cab-9a36-ebe9b54f36e3","year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.417003Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:58e572233e3c203ed8c95861f81ffc14f86332e77ec2fdcde29f07b8ae44a3d1","observation_id":"ff1d6786-dcdb-44aa-98b1-b7d56ed3a6fc","resolution":{"observed_at":"2026-08-16T12:27:49.910840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12332","last_updated":"2024-07-17T06:15:30Z","snapshot_observed_at":"2026-08-18T13:07:36.989605Z","submitted_at":"2024-07-17T06:15:30Z","title":"Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12332","snapshot_observed_at":"2026-08-16T12:27:49.422435Z","title":"Why do you grok? a theoretical analysis of grokking modular addition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.422435Z"},"links":{"cited_paper":"/paper/2407.12332","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:bd5eb7107f31ef2fede317eefcab2d9eaf29c5041862e7db4c498bbded488f11","observation_id":"f47d8d08-c895-4cee-b8d4-a1623797ef93","resolution":{"observed_at":"2026-08-16T12:27:49.422435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-16T12:27:49.427633Z","title":"Progress measures for grokking via mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.427633Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:c99216e2d30b00cdfa40bd8b920a9cd4ea981618c11fa45f155470b6e016b4ec","observation_id":"859e1c7d-fa47-424d-a059-cc31a15aaf0a","resolution":{"observed_at":"2026-08-16T12:27:49.427633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.890472Z","title":"Zoom in: An introduction to circuits,","venue":null,"work_id":"1ebfc360-9ecd-4c23-9977-4fa1a492890f","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.432674Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:aef44d65df1014dd39c74b926a580e1596b96431518ed6df1ffea565e95d7ab2","observation_id":"a3cafea8-ef25-4089-b5a6-4e7867eab224","resolution":{"observed_at":"2026-08-16T12:27:49.895185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.874450Z","title":"Hidden progress in deep learning: Sgd learns parities near the computational limit,","venue":null,"work_id":"bd4b1361-2c3f-4857-994d-4540a5a11a70","year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.437489Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:e7e99b6a4c343e82ddd0c586d684bd3e69f983b687f8b345502af0dc7d7e8843","observation_id":"3a94b629-7d64-4dbb-954e-b6d82ab4d27f","resolution":{"observed_at":"2026-08-16T12:27:49.880189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05918","last_updated":"2023-10-09T17:59:18Z","snapshot_observed_at":"2026-08-19T19:21:32.698687Z","submitted_at":"2023-10-09T17:59:18Z","title":"Grokking as Compression: A Nonlinear Complexity Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05918","snapshot_observed_at":"2026-08-16T12:27:49.442057Z","title":"Grokking as compression: A nonlinear complexity perspective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.442057Z"},"links":{"cited_paper":"/paper/2310.05918","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:572a87550cac1bcd899b7688732f617ebbfceb939ee0b2030865ff38562b77f1","observation_id":"f3511184-a246-4665-b36c-10942137da35","resolution":{"observed_at":"2026-08-16T12:27:49.442057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.859214Z","title":"Deep double descent: Where bigger models and more data hurt,","venue":null,"work_id":"3f27bd11-ddcb-4154-a353-dbe4773dbb80","year":2021},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.446982Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:4fd4158f30a3788fb21183de3184927d472e2fe81c265309496fba13a3037070","observation_id":"3f24a3bf-13c8-4f65-9153-2ef851fb1066","resolution":{"observed_at":"2026-08-16T12:27:49.863846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.844136Z","title":"Double trouble in double descent: Bias and variance (s) in the lazy regime,","venue":null,"work_id":"ee6c9730-cc11-4ec1-86fb-ff1fd612d0cf","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.451690Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:4add775cf012ce23b358776a9b8e85c4a5577babd05e746146a5f7fe7da01109","observation_id":"3707e4d1-75d8-41f8-9c6d-b24e9b488170","resolution":{"observed_at":"2026-08-16T12:27:49.848765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.826541Z","title":"A brief prehistory of double descent,","venue":null,"work_id":"2ef6c446-3b98-421f-b1ca-bb9df17d1b52","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.456102Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:c89d2038fd405b493aa67d6b3ddbd13a25b37ad4be7468b66147b500659a778d","observation_id":"57492f93-52d6-4699-a974-b4ee53ff9ef1","resolution":{"observed_at":"2026-08-16T12:27:49.832904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-16T09:10:10.815975Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-16T12:27:49.460886Z","title":"The information bottleneck method,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.460886Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:5d82a8941e64a110b63dd0b9913d42d2e4463566d3ac202f38678bcc2d358ab6","observation_id":"cd50dd40-e71e-40bd-bfac-f60eaa7b190d","resolution":{"observed_at":"2026-08-16T12:27:49.460886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.807870Z","title":"Deep learning and the information bottleneck principle,","venue":null,"work_id":"49cb8106-b0a3-4e9d-90ad-4981b5013513","year":2015},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.465744Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:05439de19cc45c234fed4a8ebf52a640580ae359b0dabc359da115480a34efa7","observation_id":"1a8d423f-b906-4940-8e01-9f806a124a11","resolution":{"observed_at":"2026-08-16T12:27:49.813452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00810","last_updated":"2017-04-29T17:32:47Z","snapshot_observed_at":"2026-08-14T21:13:52.487817Z","submitted_at":"2017-03-02T14:53:14Z","title":"Opening the Black Box of Deep Neural Networks via Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00810","snapshot_observed_at":"2026-08-16T12:27:49.470319Z","title":"Opening the black box of deep neural networks via information,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.470319Z"},"links":{"cited_paper":"/paper/1703.00810","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:641c660efcd1656cb67a65f94e70f83386269d340a382ceaf4dc41f448d9fafc","observation_id":"1f69bb5e-120a-4ff1-b985-db1853642e70","resolution":{"observed_at":"2026-08-16T12:27:49.470319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.788260Z","title":"The renormalization group: Critical phenomena and the Kondo problem,","venue":null,"work_id":"689e77ea-3069-49b9-a41f-e643dfc79c1c","year":1975},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.475257Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:f114490c45c20e9b4aaeff3f7a74d2311bcf498ec46d3e553f70a9f36e8b0206","observation_id":"d8765667-8208-4731-9164-325e0e318003","resolution":{"observed_at":"2026-08-16T12:27:49.793992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.3831","last_updated":"2014-10-14T20:00:09Z","snapshot_observed_at":"2026-08-14T23:15:43.495106Z","submitted_at":"2014-10-14T20:00:09Z","title":"An exact mapping between the Variational Renormalization Group and Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.3831","snapshot_observed_at":"2026-08-16T12:27:49.479944Z","title":"Mehta, and D.J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.479944Z"},"links":{"cited_paper":"/paper/1410.3831","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:73653daadd62572e9425bae05488034608d007186af772284cf46ebce020e397","observation_id":"9a0482e4-4954-49b6-8b9b-537c2defec9e","resolution":{"observed_at":"2026-08-16T12:27:49.479944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.770771Z","title":"Mutual information, neural networks and the renormalization group","venue":null,"work_id":"6073db67-582a-40e8-b7e6-ca8112a1db3a","year":2018},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.485258Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:e467bde02e59c5fb9476be61f4ab81040f88b9438d5c26c4e58398c70aeaa1c8","observation_id":"69eecf8b-f28e-4a04-b1e2-7a9e2b475b96","resolution":{"observed_at":"2026-08-16T12:27:49.775990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.754448Z","title":"Is deep learning a renormalization group flow?","venue":null,"work_id":"de796efb-4185-465f-81ff-67aa73a00964","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.490062Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:385a5f5bc2f121a9ea833fd99543c6ad9e709091b9c1695eec03c22c549e5443","observation_id":"0e3b1a5c-609f-4f3f-9e49-6372eb04a3e7","resolution":{"observed_at":"2026-08-16T12:27:49.759287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.738248Z","title":"Short-sighted deep learning,","venue":null,"work_id":"05c54742-50f9-4384-972b-407069f7798e","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.494720Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:7cced75a235aee2216dd4b34d7d70f1fd854bc656fd3e494d5535c16926e7fe9","observation_id":"e1d11958-4f8d-4f76-bada-4e9997dc0431","resolution":{"observed_at":"2026-08-16T12:27:49.743619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03531","last_updated":"2020-12-07T08:45:20Z","snapshot_observed_at":"2026-08-16T19:00:32.376029Z","submitted_at":"2020-12-07T08:45:20Z","title":"Why Unsupervised Deep Networks Generalize","version":1},"cited_work":{"arxiv_id":"2012.03531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03531","snapshot_observed_at":"2026-08-16T12:27:49.536150Z","title":"Why Unsupervised Deep Networks Generalize","venue":"cs.LG","work_id":"0fc58e5d-189f-4c32-a724-6e2ed864e6f5","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.499597Z"},"links":{"cited_paper":"/paper/2012.03531","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:3421c2fba578d49a6b2ef8edc274a99f1bc2a756a5d3a7a19c1fc064ece58d73","observation_id":"cf13d3e2-1d1c-4338-b338-5bbfcb6ae4b8","resolution":{"observed_at":"2026-08-16T12:27:49.543685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","latest_version":1,"primary_category":"hep-th","snapshot_observed_at":"2026-08-18T06:41:54.644600Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2504.12700."}