{"as_of":"2026-08-08T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5106753931e8ec862a6511c38343c881c7572dff5b1b1d0a16256ae419136057","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:04:29.637076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-08T15:04:29.637076Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T14:52:19.083350Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.637076Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:e6a958cd29c8195059051e3cb90bff0e740ce682fcd1c277feaadd8b81564d9a","observation_id":"53abca1b-6c74-4c3c-ba55-f33eee8ce64b","resolution":{"observed_at":"2026-08-08T15:04:29.637076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T15:42:59.545380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-07T23:55:16.149811Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.545380Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:f93146b5e60ece0ecd47195a1758839cc3d23b94e9fdfab2d80c069ec3b6f253","observation_id":"dae8452d-0891-4b6e-8f99-e09d2dee3682","resolution":{"observed_at":"2026-08-07T15:42:59.545380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T14:31:43.086949Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18690","last_updated":"2025-05-24T13:32:03Z","snapshot_observed_at":"2026-08-07T14:25:30.423247Z","submitted_at":"2025-05-24T13:32:03Z","title":"Benchmarking and Rethinking Knowledge Editing for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:43.086949Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.18690"},"observation_digest":"sha256:4914f3b31de75d688fe89164e1abcd5274f124f7fc4081ae55eb04763dcd49df","observation_id":"fac541c2-6b00-412c-af75-dd51c7efab8e","resolution":{"observed_at":"2026-08-07T14:31:43.086949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T13:47:24.755626Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws.arXiv preprint arXiv:2404.05405, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20993","last_updated":"2025-05-27T10:26:47Z","snapshot_observed_at":"2026-08-07T23:55:50.756740Z","submitted_at":"2025-05-27T10:26:47Z","title":"Who Reasons in the Large Language Models?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:47:24.755626Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.20993"},"observation_digest":"sha256:c7fe05d796e33154acd6e2e554958ae207b7bc6b569d568dc8f66758ec7fb30b","observation_id":"6f112d02-2bfd-4ede-9044-a566f22c6636","resolution":{"observed_at":"2026-08-07T13:47:24.755626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T12:35:35.752224Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24832","last_updated":"2025-06-18T15:27:03Z","snapshot_observed_at":"2026-08-08T09:16:38.722740Z","submitted_at":"2025-05-30T17:34:03Z","title":"How much do language models memorize?","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.752224Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.24832"},"observation_digest":"sha256:ca7fff37d7644f33db087eb0cc04e46981258859360407219482c0d3f5d96831","observation_id":"230120bb-4c84-4e7c-ad86-ed7509406b8b","resolution":{"observed_at":"2026-08-07T12:35:35.752224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T11:57:22.571092Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.571092Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:8eadeb10d2e8df0a744daca4ab73d709bfed12192f4bc9079022b136b5eed7a8","observation_id":"8363ba87-329c-42c9-9ecc-0a23659bea68","resolution":{"observed_at":"2026-08-07T11:57:22.571092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T00:55:16.928046Z","title":"Allen-Zhu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12312","last_updated":"2025-06-14T02:22:28Z","snapshot_observed_at":"2026-08-07T12:23:07.508214Z","submitted_at":"2025-06-14T02:22:28Z","title":"Perspective on Utilizing Foundation Models for Laboratory Automation in Materials Research","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:55:16.928046Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2506.12312"},"observation_digest":"sha256:6257b1bb05779b52b6fac9174aeeb11c76e73dcf91e6654e99d3962dbd385fe1","observation_id":"5b8cac3c-1757-41fe-92ee-44ad9b2ec53a","resolution":{"observed_at":"2026-08-07T00:55:16.928046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-06T20:20:40.991429Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03300","last_updated":"2025-07-04T05:10:20Z","snapshot_observed_at":"2026-08-07T12:31:10.910713Z","submitted_at":"2025-07-04T05:10:20Z","title":"LRM-1B: Towards Large Routing Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:20:40.991429Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2507.03300"},"observation_digest":"sha256:75af3ff2c6ba844909923d5db5b39da7d2e5b927a5b0a47318be2c7ec4d5b5c6","observation_id":"12765b3c-a70b-4027-b554-92f4ff607306","resolution":{"observed_at":"2026-08-06T20:20:40.991429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-06T11:38:39.962564Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:0b5c9ea9c13d17c416a726dc5cc3e56e290ff211a6f6579571ad311b2590f7d9","observation_id":"a2d54293-664b-4967-962c-c01c8d13cfd6","resolution":{"observed_at":"2026-05-17T04:49:03.055714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-03T15:22:46.790701Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:46.790701Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:f9a0253f09df6b63fc83aa8d8958c0415b9e8ce6d2347bcd7bd455643abd8001","observation_id":"2f4a7128-fe57-4182-bffd-7867cd67e99d","resolution":{"observed_at":"2026-08-03T15:22:46.790701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-03T14:02:56.631725Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws.arXiv preprint arXiv:2404.05405,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22088","last_updated":"2026-06-10T15:31:41Z","snapshot_observed_at":"2026-08-07T01:41:09.207562Z","submitted_at":"2025-12-26T17:20:09Z","title":"Unifying Learning Dynamics and Generalization in Transformers Scaling Law","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:02:56.631725Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2512.22088"},"observation_digest":"sha256:9b178fe8f2c880649de7c2013463e705388694804b24ad7ca25104f78a94aedf","observation_id":"80db9ad1-86fd-48bb-916b-0bdcf700aa62","resolution":{"observed_at":"2026-08-03T14:02:56.631725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:e49d4376a20385033ec4ba95ca56d8e36c96abb387cdbbfd097cf769e05df18d","observation_id":"bb00fe68-5dc0-4c74-ba4e-e5b3d945a46c","resolution":{"observed_at":"2026-05-14T23:38:16.515544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2604.08519","last_updated":"2026-04-09T17:55:50Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:55:50Z","title":"Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T17:42:31.465077Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2604.08519"},"observation_digest":"sha256:4143580ec1011d930e4b1d243307f2b5c9cc32007244befea851df3ef84170b2","observation_id":"3ca16e85-c092-4cea-870a-802d59fa8e1a","resolution":{"observed_at":"2026-05-11T06:15:59.180654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.05189","last_updated":"2026-05-06T17:53:20Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-05-06T17:53:20Z","title":"Sharp Capacity Thresholds in Linear Associative Memory: From Winner-Take-All to Listwise Retrieval","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T16:23:37.393165Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.05189"},"observation_digest":"sha256:2e41e226dce8c3f7043ac4fccb1220d6d08b9ac7590e1ddbd3e5fb95ebd88895","observation_id":"c8b17a7a-e22b-4e42-bde3-aab89807ec82","resolution":{"observed_at":"2026-05-11T18:16:09.968352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.09471","last_updated":"2026-05-10T10:56:59Z","snapshot_observed_at":"2026-08-05T20:10:28.703944Z","submitted_at":"2026-05-10T10:56:59Z","title":"The Statistical Cost of Adaptation in Multi-Source Transfer Learning","version":1},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-05-12T04:19:05.837824Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.09471"},"observation_digest":"sha256:04f43c035961d01dbaf0a24a0fd658a1a777adc23652bb124d1ec6c1a3df2b4e","observation_id":"be8cea79-b02a-41a6-9ef6-3da7a203bc97","resolution":{"observed_at":"2026-05-12T04:21:20.732302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.09724","last_updated":"2026-05-10T19:47:39Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T19:47:39Z","title":"Model Capacity Determines Grokking through Competing Memorisation and Generalisation Speeds","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T03:55:28.036044Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.09724"},"observation_digest":"sha256:d5d51d7772add0c55cf374800323de745c65907fe30926eab90538335c446a1c","observation_id":"6c2c10a4-5353-46a6-9997-5f52857e7eb0","resolution":{"observed_at":"2026-05-12T03:56:21.694097Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:8d9eeb99539f1ed7d57248dd9e5f28e936f362625d30916a3a5bf122f40f1899","observation_id":"ab0cf40e-d3e9-400d-8816-7ab6d0e3cd69","resolution":{"observed_at":"2026-05-12T07:11:25.645042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.12426","last_updated":"2026-05-12T17:22:22Z","snapshot_observed_at":"2026-07-30T10:50:56.815226Z","submitted_at":"2026-05-12T17:22:22Z","title":"Geometric Factual Recall in Transformers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T04:50:17.479689Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.12426"},"observation_digest":"sha256:d077e8dceab3894d72bf826dfb23a0b03d3d94d240c75732fe29db172dfe5e12","observation_id":"a3c588df-af3e-468f-b981-11cb2ccf4843","resolution":{"observed_at":"2026-05-13T04:52:16.765589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.18732","last_updated":"2026-05-18T17:53:44Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:53:44Z","title":"Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:59:32.371351Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.18732"},"observation_digest":"sha256:27e8ba97636ee6f80b90f0fe2b565ba177b01a346f6394a9b6ca1a40f6387e99","observation_id":"b2ddf72e-668a-46af-9637-d1fe8700ced0","resolution":{"observed_at":"2026-05-20T11:03:13.729220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.26097","last_updated":"2026-05-25T17:54:34Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:54:34Z","title":"Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:45.174086Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.26097"},"observation_digest":"sha256:cf8a2485b8ab96dc3bd443698fc20a7e6623a017cb0826c26151448356f0eb8e","observation_id":"361ac1e7-15c4-419e-9356-0939618aa96a","resolution":{"observed_at":"2026-06-29T23:24:02.010186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2606.00570","last_updated":"2026-05-30T06:44:40Z","snapshot_observed_at":"2026-08-03T04:12:33.083328Z","submitted_at":"2026-05-30T06:44:40Z","title":"Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T19:03:00.055800Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2606.00570"},"observation_digest":"sha256:d02c02e4e7e639f06cdd4ec3560b366b88c061ab80f6fa35ac484a971d08b789","observation_id":"30009f3b-5a48-4c83-89a9-bfd29aeec2b5","resolution":{"observed_at":"2026-06-28T19:32:35.384173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2606.03142","last_updated":"2026-06-02T04:36:32Z","snapshot_observed_at":"2026-08-08T17:22:57.853112Z","submitted_at":"2026-06-02T04:36:32Z","title":"Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:51.893740Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2606.03142"},"observation_digest":"sha256:d7906c0003efe8bce8b11cd81f5eb1eb9e8ea26647410fe18c313aaab684d9e0","observation_id":"34fcdca2-4fc8-4dec-8db4-b42631fa4d57","resolution":{"observed_at":"2026-07-02T02:06:26.194790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:a14eb02954da03407085497bb94c501148c92e1426f95182fb0cbe43997aea80","observation_id":"d793f814-5ab8-4bff-9e5c-0c5c149ff787","resolution":{"observed_at":"2026-07-02T07:06:44.968032Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2606.19172","last_updated":"2026-06-17T15:15:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-17T15:15:19Z","title":"User as Engram: Internalizing Per-User Memory as Local Parametric Edits","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:01.382431Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2606.19172"},"observation_digest":"sha256:7685ed683ef13829d2320f3e2b4cdb4e3a47442d30bbea3efa605ddafca2f42f","observation_id":"208f2e23-d01e-413c-8bc4-d1050aa7904b","resolution":{"observed_at":"2026-07-04T01:09:19.521587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-02T05:21:29.896353Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13432","last_updated":"2026-07-15T04:31:20Z","snapshot_observed_at":"2026-08-06T10:36:57.508468Z","submitted_at":"2026-07-15T04:31:20Z","title":"Local Redundancy: An Information-Theoretic Measure of Plasticity from Synthetic Memorization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T05:21:29.896353Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2607.13432"},"observation_digest":"sha256:ccf05ef7492fb8cb0452d4a19e7d33d266a3583aecfbb07e8e2a271b3ec2b8bd","observation_id":"5691762a-6d23-4559-9c4a-454c35006e6d","resolution":{"observed_at":"2026-08-02T05:21:29.896353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-01T06:29:14.690542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21861","last_updated":"2026-07-23T23:14:59Z","snapshot_observed_at":"2026-08-07T01:31:36.362218Z","submitted_at":"2026-07-23T23:14:59Z","title":"Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T06:29:14.690542Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2607.21861"},"observation_digest":"sha256:d6ce05fb346467ddfc44a81ba151c1784463bf73c07e20e8b05e36f200cf3ab9","observation_id":"77a5b3a1-41fd-43c3-a040-0b17199b8e21","resolution":{"observed_at":"2026-08-01T06:29:14.690542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.05405/citation-record","integrity":"/paper/2404.05405/integrity","json":"/paper/2404.05405/citation-record.json","paper":"/paper/2404.05405"},"outbound":[],"paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2404.05405."}