{"as_of":"2026-08-07T18:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f8b71ad4af1bf827d7bec31debd7c62f0e2abe59e1b4c14f925160680a7b0f6","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:04:55.962152Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:02:06.788056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:46:25.975143Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"cited_work":{"arxiv_id":"2506.09099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09099","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barron and D","venue":null,"work_id":"fafc30f5-968b-474d-9e9c-247f80740040","year":2025},"citing_paper":{"arxiv_id":"2605.09678","last_updated":"2026-05-10T17:55:38Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T17:55:38Z","title":"Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:02:06.788056Z"},"links":{"cited_paper":"/paper/2506.09099","citing_paper":"/paper/2605.09678"},"observation_digest":"sha256:1f9201b65b925e788f0d2c6d48c9e7c2ab9632cc68ed520dbbeb758ea5d3e36a","observation_id":"6a6da3b7-5808-4654-9ae7-d0e6edac71f7","resolution":{"observed_at":"2026-05-12T07:46:25.982733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09099/citation-record","integrity":"/paper/2506.09099/integrity","json":"/paper/2506.09099/citation-record.json","paper":"/paper/2506.09099"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:04:55.911995Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.911995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:98ce52ab71bfdd6393c614ddf367f6c992065b4e694cb3d0d3651d28f8f9aaf1","observation_id":"8161e917-cecd-4e3a-a2a4-1c889c3a655e","resolution":{"observed_at":"2026-08-07T05:04:55.911995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:56.164480Z","title":"9, 2024); accessed May 19,","venue":null,"work_id":"c99eb095-eeb6-471f-8c47-8e788f8e9776","year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.925247Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:cc49368ffb7f032f24d8a46ce5db3c6818c5e4c5a3f4ef4e2a59adba9f9c1d3f","observation_id":"57c1af3c-30f3-4ba1-8fa7-3fe26dac7beb","resolution":{"observed_at":"2026-08-07T05:04:56.167851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:55.932743Z","title":"doi: 10.1016/j.neunet.2024.106550","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.932743Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:c1747fb261995816ad4144a492d9409400dd1a24b71d319074b5034a4877dffe","observation_id":"04fcb939-cc24-4f4e-89c4-98b4e2b86369","resolution":{"observed_at":"2026-08-07T05:04:55.932743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:04:55.936614Z","title":"Pareja, A., Nayak, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.936614Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:2c97ac6e1da658a15c4b4f9305b3a38136569323ea2db78c67c29f265de395b9","observation_id":"d55ccfad-9b27-495b-b0a9-0810362e5e9e","resolution":{"observed_at":"2026-08-07T05:04:55.936614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13337","last_updated":"2024-12-17T21:16:59Z","snapshot_observed_at":"2026-07-06T20:08:51.664923Z","submitted_at":"2024-12-17T21:16:59Z","title":"Unveiling the Secret Recipe: A Guide For Supervised Fine-Tuning Small LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13337","snapshot_observed_at":"2026-08-07T05:04:55.940338Z","title":"Power, A., Burda, Y ., Edwards, H., Babuschkin, I., and Misra, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.940338Z"},"links":{"cited_paper":"/paper/2412.13337","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:ce2edad23b4c6a319ad49b9d2da5003025e11802a2a89a548e386f8ecccf08ed","observation_id":"e040c504-c48e-47f9-8502-6c11da144c51","resolution":{"observed_at":"2026-08-07T05:04:55.940338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-07T05:04:55.944197Z","title":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.944197Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:288af1a602ce1bae655f396c889be1ebfdbac6774fde0a8b9573e2802c28c0d7","observation_id":"170e1a5b-513d-4023-b290-12eee9943dc2","resolution":{"observed_at":"2026-08-07T05:04:55.944197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10770","last_updated":"2022-11-02T19:53:44Z","snapshot_observed_at":"2026-08-04T19:04:06.757797Z","submitted_at":"2022-05-22T07:43:50Z","title":"Memorization Without Overfitting: Analyzing the Training Dynamics of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10770","snapshot_observed_at":"2026-08-07T05:04:55.951254Z","title":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.951254Z"},"links":{"cited_paper":"/paper/2205.10770","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:211f62a7e207a69dee2f6a9e97be306574adbd5d49592d1d327e468faac7e7a6","observation_id":"d414a4b0-7877-4fb0-bf7d-2931d92c6792","resolution":{"observed_at":"2026-08-07T05:04:55.951254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15071","last_updated":"2024-10-30T18:47:53Z","snapshot_observed_at":"2026-07-06T18:19:00.169416Z","submitted_at":"2024-05-23T21:42:19Z","title":"Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15071","snapshot_observed_at":"2026-08-07T05:04:55.954824Z","title":"Wang, X., Antoniades, A., Elazar, Y ., Amayuelas, A., Al- balak, A., Zhang, K., and Wang, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.954824Z"},"links":{"cited_paper":"/paper/2405.15071","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:c63b80d80a78118bde2c78f70313dc7564fa570b3e6d8456b08038394ee9d92b","observation_id":"43e43de8-b55d-4d46-8ce2-d425768a8620","resolution":{"observed_at":"2026-08-07T05:04:55.954824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06714","last_updated":"2024-02-22T21:19:59Z","snapshot_observed_at":"2026-07-06T16:30:33.889293Z","submitted_at":"2023-10-10T15:41:26Z","title":"Exploring Memorization in Fine-tuned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06714","snapshot_observed_at":"2026-08-07T05:04:55.958433Z","title":"Controlled Regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.958433Z"},"links":{"cited_paper":"/paper/2310.06714","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:52fbab2bbfe49850e4d05ecae9fd6eec37a898692b70b109a3a260c2c6a32402","observation_id":"456e782f-fb2c-42de-9a69-8828c499f5c4","resolution":{"observed_at":"2026-08-07T05:04:55.958433Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:56.152607Z","title":"Goldilocks zone","venue":null,"work_id":"9683272c-b721-4ade-bffd-d0d9178ac8c2","year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.962152Z"},"links":{"citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:fa837ee8b0bd9c6f483c82de667ed77e9077e9b39c03601214d3b440aea6d3ea","observation_id":"48de51b3-0a53-43ee-91df-0e18c07519cb","resolution":{"observed_at":"2026-08-07T05:04:56.157226Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:04:55.948019Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.948019Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:adb28a92c78786f42da76c2625e6fa141dd9d3a6cd5de061c3a6572b27dc8e24","observation_id":"6083ae0c-f92c-4cd0-93e5-190a11b12064","resolution":{"observed_at":"2026-08-07T05:04:55.948019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10343","last_updated":"2022-10-14T17:39:04Z","snapshot_observed_at":"2026-08-06T16:59:52.410150Z","submitted_at":"2022-05-20T17:56:17Z","title":"Towards Understanding Grokking: An Effective Theory of Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10343","snapshot_observed_at":"2026-08-07T05:04:55.929001Z","title":"Maltoni, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.929001Z"},"links":{"cited_paper":"/paper/2205.10343","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:0f95ae02655293e80ca36789da3bd8287dbdcb46b952e756fac137d5c6f0cec1","observation_id":"f86a55e6-0981-4687-a4ba-da29f92be046","resolution":{"observed_at":"2026-08-07T05:04:55.929001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:04:55.921232Z","title":"2024 Edition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.921232Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:06a21a4f39730a62d2efa83898dae149c0ec2777f24ee428f402a21c49833f26","observation_id":"7d4bf7da-300f-490b-b06e-29a15f30c65a","resolution":{"observed_at":"2026-08-07T05:04:55.921232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T05:04:55.916932Z","title":"org/abs/2501.17161","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:55.916932Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.09099"},"observation_digest":"sha256:06edef2c2584232475cb526ceec4d5babd2b3bac80dc73f380f74b98bb7e5966","observation_id":"a0b355b9-aa0d-4b4d-9c9b-0e98309b49f6","resolution":{"observed_at":"2026-08-07T05:04:55.916932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09099","last_updated":"2025-06-17T19:17:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:57:50.115972Z","submitted_at":"2025-06-10T14:49:33Z","title":"Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 1 inbound Pith citation observation for arXiv:2506.09099."}