{"as_of":"2026-08-18T00:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae07edbd9536af62e0d3cb5f2181cd517a915905f0117b38850d723c6e21bc02","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:33:21.786029Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:49.743234Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:29.556892Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-08-07T14:57:49.743234Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16959","last_updated":"2025-09-01T20:18:07Z","snapshot_observed_at":"2026-08-17T21:14:20.258687Z","submitted_at":"2025-05-22T17:40:08Z","title":"Bigger Isn't Always Memorizing: Early Stopping Overparameterized Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:49.743234Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2505.16959"},"observation_digest":"sha256:d7082d42ede5b79bba937d1141dbd6465d7d3fbd0c5776792a33710c6cdb35c8","observation_id":"996bb69f-a046-4837-84ee-6a7fa91a1359","resolution":{"observed_at":"2026-08-07T14:57:49.743234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2604.21691","last_updated":"2026-04-23T13:58:12Z","snapshot_observed_at":"2026-08-02T12:48:50.592713Z","submitted_at":"2026-04-23T13:58:12Z","title":"There Will Be a Scientific Theory of Deep Learning","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-09T20:11:17.616190Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2604.21691"},"observation_digest":"sha256:3b3cc8c0e0666d6b6a391497824db2501671a4e40317d31d41e30a0bb41b8db1","observation_id":"80e5ba8a-a8a2-4eef-9c91-01084d4e394a","resolution":{"observed_at":"2026-05-11T15:21:08.888651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2605.10395","last_updated":"2026-05-11T11:39:03Z","snapshot_observed_at":"2026-08-11T16:49:13.188695Z","submitted_at":"2026-05-11T11:39:03Z","title":"Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:55:52.782619Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2605.10395"},"observation_digest":"sha256:ed61ed66c4d34aeffe903092558a06bc769bbd57ef20c9ca6fca9b8e99ef9225","observation_id":"3fb4679a-96b0-4403-9111-35b2b192ddfa","resolution":{"observed_at":"2026-05-12T02:56:18.758324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2606.20347","last_updated":"2026-06-18T15:15:57Z","snapshot_observed_at":"2026-08-14T03:12:45.990611Z","submitted_at":"2026-06-18T15:15:57Z","title":"Critical Percolation as a Synthetic Data Model for Interpretability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:41:29.317167Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2606.20347"},"observation_digest":"sha256:a216b4ce49dec7bad43c984b8cb7e21d3f3d98dca25353858d4dd92cf7e0f0b1","observation_id":"b683e84a-5e00-46a0-a04f-3400ca996521","resolution":{"observed_at":"2026-07-04T03:49:29.559329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07067/citation-record","integrity":"/paper/2505.07067/integrity","json":"/paper/2505.07067/citation-record.json","paper":"/paper/2505.07067"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.621381Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.621381Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:d302e2a104d6fdac4b5fcafdfd99c863adde9bc4d3371b67315d455dff5b1b19","observation_id":"10b05bb5-9278-47e7-a693-a4a1b7ce7783","resolution":{"observed_at":"2026-08-15T22:33:21.621381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16367","last_updated":"2025-03-16T05:23:12Z","snapshot_observed_at":"2026-08-16T13:58:00.214064Z","submitted_at":"2024-04-25T07:10:29Z","title":"Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16367","snapshot_observed_at":"2026-08-15T22:33:21.626412Z","title":"A., Goyal, N., and Tsvetkov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.626412Z"},"links":{"cited_paper":"/paper/2404.16367","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:47417b6ec07f015d1dd256da027ab8ceb96389a309d1492b859cfe7b6e981394","observation_id":"7d1f0b21-312f-49f7-8ef0-6563f8a4bedf","resolution":{"observed_at":"2026-08-15T22:33:21.626412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-16T15:30:48.952049Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-15T22:33:21.630841Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.630841Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:8e0cc7bf7051f90a118dadd751852a6eef3d33b1e811cc5b7a8fd6132669f53a","observation_id":"f5f9aac2-dfa6-42fc-b4d1-68495d63d4e8","resolution":{"observed_at":"2026-08-15T22:33:21.630841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06701","last_updated":"2024-04-29T00:55:09Z","snapshot_observed_at":"2026-08-16T18:45:54.659137Z","submitted_at":"2021-02-12T18:57:46Z","title":"Explaining Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06701","snapshot_observed_at":"2026-08-15T22:33:21.635325Z","title":"Explaining neural scaling laws","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.635325Z"},"links":{"cited_paper":"/paper/2102.06701","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c4abd017723eb6a515f95f4be405325f4877782f907e5b077941ed62e7bd49e0","observation_id":"037ed2ad-2136-4a5f-b09c-45bde0bcaf27","resolution":{"observed_at":"2026-08-15T22:33:21.635325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.639290Z","title":"Spectrum dependent learning curves in kernel regression and wide neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.639290Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:d850d073139534378739b5043e710e66a7e17ab5a16d7d066cea51db27011a4a","observation_id":"e59f5920-8f88-4760-9ad3-a088a3847748","resolution":{"observed_at":"2026-08-15T22:33:21.639290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.320875Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":"b65d63ea-d3d8-4e77-b312-a04d178e7071","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.643090Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:f8d3250a7d95bb7881c9d92e4fd6c189aaf3d53e84d30f7062951fe03ca0506d","observation_id":"b71dd437-dc7f-4389-aea9-f726af0449a0","resolution":{"observed_at":"2026-08-15T22:33:22.325482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04289","last_updated":"2025-01-12T15:43:54Z","snapshot_observed_at":"2026-08-16T13:45:25.885980Z","submitted_at":"2024-06-06T17:34:24Z","title":"What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04289","snapshot_observed_at":"2026-08-15T22:33:21.646947Z","title":"What languages are easy to language-model? a perspective from learning probabilistic regular languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.646947Z"},"links":{"cited_paper":"/paper/2406.04289","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:6ecefbfb0fa784bc86d54ec63d53a9b71c277b91182ddbf603146af7157dac11","observation_id":"3df813e5-f6cd-4bfd-a157-de6127eafb5d","resolution":{"observed_at":"2026-08-15T22:33:21.646947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.307450Z","title":"and Wyart, M","venue":null,"work_id":"8185f28a-c3ba-419e-b30f-49abd592fec2","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.651058Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:fc567706c34adea1a16e8c9d8252713a0e1f437ac38b2bea6ad93e322a08607b","observation_id":"e81647df-8698-4fd6-9a52-03e932a0ecd9","resolution":{"observed_at":"2026-08-15T22:33:22.312126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.293369Z","title":"What can be learnt with wide convolutional neural networks? In International Conference on Machine Learning, pp.\\ 3347--3379","venue":null,"work_id":"a56fa799-8dbd-41e2-8805-6fc5b0a8cb4c","year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.654722Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:aa6ef875cfda2b528e852e3ed4c1ae032e3386a4f0a970d7f447aa75ee2007d2","observation_id":"3ee2626b-7ca6-4dc3-a36f-7db5a3e3e51b","resolution":{"observed_at":"2026-08-15T22:33:22.298937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.658118Z","title":"M., Favero, A., and Wyart, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.658118Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:02134b67a26227bc8db6f653715da4e672592c97f3daa305e816af7fe8d2eaa3","observation_id":"7d312aba-cf20-408d-a688-63570fdaa7bf","resolution":{"observed_at":"2026-08-15T22:33:21.658118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.662069Z","title":"and De Vito, E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.662069Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:7aeba79f8c0d9f9e01c93d9f11d523718548a987085ef75ad7673edb6b90a35d","observation_id":"6e7d163a-4b86-4cc4-b6db-a5070029889d","resolution":{"observed_at":"2026-08-15T22:33:21.662069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0129031","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.861921Z","title":"Zipf’s law for word frequencies: Word forms versus lemmas in long texts","venue":null,"work_id":"1b2ca444-8abb-4a03-b50b-00116d11bfc4","year":2015},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.665654Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:7ad1eb2b3e51df6f71d66f2a921e2279492b4ffbbb0e44b09131c9aff983b9fa","observation_id":"f99e74f8-8108-47f4-ae79-f1df47b86236","resolution":{"observed_at":"2026-08-15T22:33:21.867235Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.271760Z","title":"Locality defeats the curse of dimensionality in convolutional teacher-student scenarios","venue":null,"work_id":"320fc6d2-7f9c-4b48-9c63-49d1e2603cc1","year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.669334Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:58b7384753b4ec071e0545bf244c8da0f662ab84baa3a955a22c9b87925ffc5d","observation_id":"9553ab42-fbec-48b6-85c4-91460344687c","resolution":{"observed_at":"2026-08-15T22:33:22.277673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15138","last_updated":"2025-06-10T08:51:44Z","snapshot_observed_at":"2026-08-16T13:23:27.707681Z","submitted_at":"2024-08-27T15:23:09Z","title":"How transformers learn structured data: insights from hierarchical filtering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15138","snapshot_observed_at":"2026-08-15T22:33:21.672915Z","title":"How transformers learn structured data: insights from hierarchical filtering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.672915Z"},"links":{"cited_paper":"/paper/2408.15138","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:f64c3aed3e82393314f8c4ce694a2b5e11d90efa0d3e658ece95c4830d246f9c","observation_id":"17eda9c2-8e77-4052-b51b-a098b7afc779","resolution":{"observed_at":"2026-08-15T22:33:21.672915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-15T22:33:21.676902Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.676902Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:a33c9e7beaac6ab60cd00af25b77a474196b70be2a315368949df3ce76eb0185","observation_id":"59d1cce2-4e93-4010-8629-dfccf3baa106","resolution":{"observed_at":"2026-08-15T22:33:21.676902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.680716Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Vinyals, O., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.680716Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:ff67f6c5fcf29211e256beb531a1a8ee27edf37b7575e5e3bb371541424966a4","observation_id":"370b3d2d-f89b-46a9-8f55-9b007661bd15","resolution":{"observed_at":"2026-08-15T22:33:21.680716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04074","last_updated":"2021-02-08T09:25:31Z","snapshot_observed_at":"2026-08-16T18:47:05.682706Z","submitted_at":"2021-02-08T09:25:31Z","title":"Learning Curve Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04074","snapshot_observed_at":"2026-08-15T22:33:21.684571Z","title":"Learning curve theory","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.684571Z"},"links":{"cited_paper":"/paper/2102.04074","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:e10398f7ef7e4ff043951da9a096d7bee844bbfdba986298aeb3a39cb71a7da9","observation_id":"26c4e34b-b196-48fc-9500-941d088d144d","resolution":{"observed_at":"2026-08-15T22:33:21.684571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.250613Z","title":null,"venue":null,"work_id":"6f6463f4-cf0e-48db-9278-5799d7dabc88","year":1985},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.688223Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:eb7e5330c0cf8437654039dc0c4ca51bc3d5d288b433cdd3c2ae097d537aae4e","observation_id":"00377fe1-9ad3-4ca0-828a-47d2366ee67b","resolution":{"observed_at":"2026-08-15T22:33:22.255926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:33:21.692038Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.692038Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:86d10c8d40bd2af206bc57b24ffd5245f5506f0959edce5a9d0e0973b6eeee3e","observation_id":"344c551c-6508-4443-a88d-4c89244988f1","resolution":{"observed_at":"2026-08-15T22:33:21.692038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.235159Z","title":null,"venue":null,"work_id":"995058d7-1cba-4cf7-8fe2-aa87141c17c9","year":1968},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.696428Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:64b0d02495f28553f7ce0bc9b16525ba85a51a11c0e64aa1e80dbb0c1b0573e0","observation_id":"2faad500-454a-4815-abbc-1ca034d6d395","resolution":{"observed_at":"2026-08-15T22:33:22.239729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.221937Z","title":"M., Bartlett, P., and Lee, J","venue":null,"work_id":"ace54b62-745f-4b1a-bda1-c6e04e926d6c","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.700945Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:6c93e09db5c49e0892dd031002f06d3dfe95768e4c074bbc53f879b8a6d4b4fc","observation_id":"526fac67-a2a3-477e-8339-0cb338ee8372","resolution":{"observed_at":"2026-08-15T22:33:22.226848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09522","last_updated":"2018-06-24T13:55:48Z","snapshot_observed_at":"2026-08-14T19:32:30.606890Z","submitted_at":"2018-03-26T11:48:14Z","title":"A Provably Correct Algorithm for Deep Learning that Actually Works","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09522","snapshot_observed_at":"2026-08-15T22:33:21.704619Z","title":"and Shalev-Shwartz, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.704619Z"},"links":{"cited_paper":"/paper/1803.09522","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:ec0e887d293b10e83e45a3db905495bc491e8b11fdf3785d8c0f4e7f7af8d3c0","observation_id":"a7494ae6-3f48-43ab-832f-548a891ec17a","resolution":{"observed_at":"2026-08-15T22:33:21.704619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.208501Z","title":"and Shalev-Shwartz, S","venue":null,"work_id":"6f29618d-60fd-41f6-afe3-c228f1a55cdc","year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.708371Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b9031af76f152dbe9b83020e8e6cc84bea1ddcc66afbb40be63e6351951eafff","observation_id":"c0288d79-3763-4f99-9567-bb8ea117fa41","resolution":{"observed_at":"2026-08-15T22:33:22.213232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-08-17T11:15:48.593128Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-15T22:33:21.711932Z","title":"A., and Sully, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.711932Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:627e57eaad6f8816b37955b9901f3e70dcd1a536a6143d496d48ccd7d4e49b03","observation_id":"82a2769b-26e2-4607-b9fd-bf50baff3df2","resolution":{"observed_at":"2026-08-15T22:33:21.711932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.715596Z","title":"T., Frank, R., and Linzen, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.715596Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:28109f29d42d0118907b8f24540bb40d3d066d70f9a627962bdd2ce650ed3f50","observation_id":"a8b46bfd-db3d-4b03-8e6d-bcff458efff3","resolution":{"observed_at":"2026-08-15T22:33:21.715596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18444","last_updated":"2024-05-01T16:49:57Z","snapshot_observed_at":"2026-08-17T20:34:03.038727Z","submitted_at":"2024-04-29T05:57:03Z","title":"U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18444","snapshot_observed_at":"2026-08-15T22:33:21.719274Z","title":"U-nets as belief propagation: Efficient classification, denoising, and diffusion in generative hierarchical models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.719274Z"},"links":{"cited_paper":"/paper/2404.18444","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:936167dd67c64bff9430f5052adbb9c2ace533d695aaf7e691aff0b62679e346","observation_id":"a750fd93-4be7-42e3-aae3-39acc916f719","resolution":{"observed_at":"2026-08-15T22:33:21.719274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.194933Z","title":"J., Liu, Z., Girit, U., and Tegmark, M","venue":null,"work_id":"3c66015b-85d6-46e8-ba20-0e2055e99667","year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.723088Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:3a9c9307d1f70fbbda5ad0ab8e7470cb538149dab7c3424f7bc7304dc0ba8200","observation_id":"002f735f-b218-4ea6-a091-03778be8fc09","resolution":{"observed_at":"2026-08-15T22:33:22.200022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.181945Z","title":"Understanding transformers via n-gram statistics","venue":null,"work_id":"3dd30e0c-9c96-4844-a6aa-9eec895f435c","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.726568Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:4bcb6f7663fe29fcb45469c3286b704177863caa06ce3aff9928b1b89890d930","observation_id":"43469283-6cab-4aa1-9a9f-35fabda7b813","resolution":{"observed_at":"2026-08-15T22:33:22.186965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.729984Z","title":"A statistical theory of contrastive pre-training and multimodal generative ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.729984Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:15de45ecf6b4f388efc9935f9c3d9d7c6fca821f36754314c4a270c3a62d4cdf","observation_id":"f2bd2139-fad6-46f7-becf-3e5a7e6be9d6","resolution":{"observed_at":"2026-08-15T22:33:21.729984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.733749Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.733749Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:a3080c823aec83d84d37924f52b4ad191115dca5599e5f3ef599d41a51904b33","observation_id":"a6e8fa48-33dc-40b6-b9c6-c15c7fc41ea0","resolution":{"observed_at":"2026-08-15T22:33:21.733749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.161651Z","title":"PyTorch : An Imperative Style , High - Performance Deep Learning Library","venue":null,"work_id":"7aa634a0-bf30-4c1e-a303-84dc1727f3d6","year":2019},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.737115Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:dc043453c23a0eab775b05e66f9d4b87001d66f293f2cd7ecc5307ea5b6d36e6","observation_id":"406f6694-edd0-449c-91e6-3b3a697f4588","resolution":{"observed_at":"2026-08-15T22:33:22.166353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00360802","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.841798Z","title":null,"venue":null,"work_id":"5acd0c57-7e05-4610-9d59-9f3a79e988da","year":1982},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.740406Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:6c31f8bca8f18fd9b5e5d94c198621f957a079dd4ddefa767156e02a64fa099a","observation_id":"b7eb5af7-3fb6-4a0e-bac1-e90d66f5a477","resolution":{"observed_at":"2026-08-15T22:33:21.845584Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.744124Z","title":"and Salomaa, A","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.744124Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:87db25f8e0de025c1730ec977ed0f257f4c9b1563d281712cf67b96423851595","observation_id":"9ecbca3a-1e5e-4147-b1f6-446b449c637a","resolution":{"observed_at":"2026-08-15T22:33:21.744124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13770","last_updated":"2025-02-28T20:28:34Z","snapshot_observed_at":"2026-08-16T13:08:19.637152Z","submitted_at":"2024-10-17T17:08:39Z","title":"Probing the Latent Hierarchical Structure of Data via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13770","snapshot_observed_at":"2026-08-15T22:33:21.747702Z","title":"I., and Wyart, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.747702Z"},"links":{"cited_paper":"/paper/2410.13770","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:bc41c210548ce96364efee4ab4f79bf8e1d0cd0bd75c4d7da58341e8c82edee8","observation_id":"318b528d-244a-4bb5-8c78-91e935f01511","resolution":{"observed_at":"2026-08-15T22:33:21.747702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.752658Z","title":"A phase transition in diffusion models reveals the hierarchical nature of data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.752658Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:eba9a02d0820ec7559d76858564c46eb1fd4219bfc67c346651471f9cc16b28e","observation_id":"32494d23-33d0-450a-82d6-50bc6b53c0cb","resolution":{"observed_at":"2026-08-15T22:33:21.752658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15943","last_updated":"2025-02-04T03:38:57Z","snapshot_observed_at":"2026-08-16T13:49:35.878650Z","submitted_at":"2024-05-24T21:14:10Z","title":"Transformers represent belief state geometry in their residual stream","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15943","snapshot_observed_at":"2026-08-15T22:33:21.756480Z","title":"S., Marzen, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.756480Z"},"links":{"cited_paper":"/paper/2405.15943","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:2a6b333534cd2fc13404d67ff4a21f5b093f9097a4ec133185834ba36715291e","observation_id":"f2dc5578-d7d1-4ee9-8051-2987a6d05091","resolution":{"observed_at":"2026-08-15T22:33:21.756480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.146469Z","title":"Asymptotic learning curves of kernel methods: empirical data versus teacher–student paradigm","venue":null,"work_id":"f4f221e3-e00e-4e43-b7ff-43cf444ce972","year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.760130Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:fbd9716d1646707632c74066fa33efc848d413e30815fc0fb907e19129fc8a58","observation_id":"e1294578-c4e2-4381-aa2d-151441bdc5e2","resolution":{"observed_at":"2026-08-15T22:33:22.151660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14994","last_updated":"2024-06-20T15:21:23Z","snapshot_observed_at":"2026-08-16T13:58:32.954473Z","submitted_at":"2024-04-23T12:51:37Z","title":"Transformers Can Represent $n$-gram Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14994","snapshot_observed_at":"2026-08-15T22:33:21.763465Z","title":"and Cotterell, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.763465Z"},"links":{"cited_paper":"/paper/2404.14994","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c75ae2d0c31657fe81ab8a427c1c0227fc83c83f0346e0cf7b9b0d922e7a223c","observation_id":"157d7e55-b743-467d-9492-61bdb33c4707","resolution":{"observed_at":"2026-08-15T22:33:21.763465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03001","last_updated":"2024-10-03T21:21:02Z","snapshot_observed_at":"2026-08-16T13:12:46.887083Z","submitted_at":"2024-10-03T21:21:02Z","title":"Can Transformers Learn $n$-gram Language Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03001","snapshot_observed_at":"2026-08-15T22:33:21.767555Z","title":"Can transformers learn n -gram language models? arXiv preprint arXiv:2410.03001, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.767555Z"},"links":{"cited_paper":"/paper/2410.03001","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:8ac66c979c4abb8ec78fc6dff7d5984cca902e251938e213fc83a00278e3d923","observation_id":"0f6e61bc-18ba-4be2-a204-186c8b956881","resolution":{"observed_at":"2026-08-15T22:33:21.767555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.131649Z","title":null,"venue":null,"work_id":"f8243015-4dfd-4a10-b162-114329b1d94b","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.771419Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c00ae1887b02303a26126465e180e11312a9299af344b64ffa1f436f4ff809ac","observation_id":"d329c099-752a-4831-9b5e-2f49d60ac138","resolution":{"observed_at":"2026-08-15T22:33:22.137635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.774650Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.774650Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:3cbed17b6d3999900fc71211e7877a0ab3bb2ee7685d6e077c1282f2712c3eab","observation_id":"ea2e2881-bca5-4459-b5db-efbc3c5f2232","resolution":{"observed_at":"2026-08-15T22:33:21.774650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-16T19:02:26.158343Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-15T22:33:21.778155Z","title":"and Hu, E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.778155Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:0a5c95f84347938f100b40b0bf66d835f9462f4bf7de268c198f4aca999a43ee","observation_id":"7c19e1ac-989e-450d-8a10-a6704a878015","resolution":{"observed_at":"2026-08-15T22:33:21.778155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08117","last_updated":"2023-10-16T03:27:53Z","snapshot_observed_at":"2026-08-17T14:58:33.944003Z","submitted_at":"2023-03-14T17:49:50Z","title":"Do Transformers Parse while Predicting the Masked Word?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08117","snapshot_observed_at":"2026-08-15T22:33:21.782186Z","title":"Do transformers parse while predicting the masked word? arXiv preprint arXiv:2303.08117, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.782186Z"},"links":{"cited_paper":"/paper/2303.08117","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:4602fd24fa28b8e199dfd20049ec8e018b9b6dbeeca74e687315b78fd8302e35","observation_id":"8e97ade3-a463-49c7-a87c-90de7f60537f","resolution":{"observed_at":"2026-08-15T22:33:21.782186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1561/0600000017","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.813681Z","title":"and Mumford, D","venue":null,"work_id":"88ed3f37-8831-439b-862e-32bcaa327b04","year":2006},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.786029Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b2a047d87d68c610defd551289998d8cb18da5be1a3f4f30abd553ce6d143cde","observation_id":"11fd114e-107e-4db0-b722-6f5d2be9070b","resolution":{"observed_at":"2026-08-15T22:33:21.818742Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-15T22:23:34.975826Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2505.07067."}