{"as_of":"2026-08-17T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7ab893177ef56dbe5b6940c7ef8aa98452453f62bfb6c395bb8b16daa651078","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:31:44.464243Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:02:56.648836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:43:15.231264Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07070","snapshot_observed_at":"2026-08-03T14:02:56.648836Z","title":"Scal- ing laws and representation learning in simple hierarchical languages: Transformers vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22088","last_updated":"2026-06-10T15:31:41Z","snapshot_observed_at":"2026-08-15T18:34:42.958067Z","submitted_at":"2025-12-26T17:20:09Z","title":"Unifying Learning Dynamics and Generalization in Transformers Scaling Law","version":3},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-03T14:02:56.648836Z"},"links":{"cited_paper":"/paper/2505.07070","citing_paper":"/paper/2512.22088"},"observation_digest":"sha256:27b2a92f895197afe4e6c9c30881f6f152365b7ebc2103e3c234a2f5302d558b","observation_id":"2b9d6123-39db-4799-bfff-b3f51a7b958b","resolution":{"observed_at":"2026-08-03T14:02:56.648836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"cited_work":{"arxiv_id":"2505.07070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07070","snapshot_observed_at":"2026-06-29T08:43:15.231264Z","title":"Scaling laws and representation learning in simple hierarchical languages: Transformers vs","venue":null,"work_id":"87c96792-4c4d-44e5-bb5b-4dc86a0976a0","year":2025},"citing_paper":{"arxiv_id":"2605.29548","last_updated":"2026-06-01T17:29:35Z","snapshot_observed_at":"2026-08-16T11:18:57.974744Z","submitted_at":"2026-05-28T08:02:11Z","title":"Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T08:39:14.327838Z"},"links":{"cited_paper":"/paper/2505.07070","citing_paper":"/paper/2605.29548"},"observation_digest":"sha256:42e216b0f1fdb1ee2ad9f3e4b773e99511ccabba0e87520eff26540f589a9b7d","observation_id":"06b7a6b0-124c-467f-a929-7bacaa79ff39","resolution":{"observed_at":"2026-06-29T08:43:15.232804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07070/citation-record","integrity":"/paper/2505.07070/integrity","json":"/paper/2505.07070/citation-record.json","paper":"/paper/2505.07070"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.824071Z","title":"These correlations are given by the fol- lowing (vm)×v C(X−t,X−1)µ,ν :=P{X−t =µ,X−1 =ν} − P{X−t =µ} P{X−1 =ν}","venue":null,"work_id":"25d609b2-65a4-44ac-bb47-100b01e2ee37","year":null},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.139930Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:1b24e1eabe3c96b15f26e10be1ae01df270ed164cf5e3628e84987258d271ce6","observation_id":"f9620582-b90a-4f23-b3d9-3ee458305c03","resolution":{"observed_at":"2026-08-15T22:31:45.831027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.804782Z","title":"These tuples have a smaller tree dis- tance from X−1 than tuples of input tokens, thus the corresponding sample complexities are lower than those required by Eq","venue":null,"work_id":"9920b27b-5037-4621-9d95-52ffde00ce07","year":null},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.144578Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:6a93dee43b7521f66d9bbcafd351886f294e0c17035d7ebd5337ea0ade774dfa","observation_id":"f3556d56-50e0-49d3-b6ad-c5d28707de41","resolution":{"observed_at":"2026-08-15T22:31:45.811345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.787313Z","title":"Therefore, a learner could infer all level- L latents 7 as soon as it’s able to infer µ (L) −2, which is the easiest to infer as it has the strongest correlation with X−1","venue":null,"work_id":"5581b3fb-21b1-4645-b747-61fea19203d8","year":null},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.149055Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:2a22d5e5796563a31f4be8b6409b70165f828616a7152a4d782f18a914a90cf8","observation_id":"b45de51a-e311-4bca-9866-dfb743831000","resolution":{"observed_at":"2026-08-15T22:31:45.792772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-15T22:31:44.170303Z","title":"Hoffmann, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.170303Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:f905bb70ab559b33a11013536216686195aacc5f32d67d3bc50fdbd96ef79ee9","observation_id":"0da5e4c7-762c-4326-b1ee-3adeac97ada5","resolution":{"observed_at":"2026-08-15T22:31:44.170303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-15T22:31:44.154778Z","title":"Hestness, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.154778Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:fce93b1368cf4fcbed11bf32ec396f9318a402cc9be041bb44bad47e4b0073a0","observation_id":"21fd111c-2f48-42ae-9a06-03b4460cab0e","resolution":{"observed_at":"2026-08-15T22:31:44.154778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:31:44.160078Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.160078Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:8c74f377d919d97a447fa254fa4077c039a5e32b500552bc7785d60e538ce2f5","observation_id":"f942c378-591d-4928-8f36-49f760bfc7c3","resolution":{"observed_at":"2026-08-15T22:31:44.160078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-15T22:31:44.165225Z","title":"Henighan, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.165225Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:9525d9f4a009ad2eb84b28fbf3c499eca4200f279f89578bc79f28b261aada85","observation_id":"a70d5954-3680-4b59-bae7-559f0a4f200e","resolution":{"observed_at":"2026-08-15T22:31:44.165225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.844208Z","title":null,"venue":null,"work_id":"abb92d7b-17d6-428d-967d-a361c8ad654a","year":null},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.133951Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:db42b33bca3a22b395f81a88fb4bd021a756117d4498032a0dd5a83504043631","observation_id":"6507dd54-7b49-45ac-9420-0c5d0e63cee1","resolution":{"observed_at":"2026-08-15T22:31:45.849248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.758859Z","title":null,"venue":null,"work_id":"966d6a9e-9f71-45a5-b758-86d92a5b2f6e","year":1967},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.176083Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ed3bd26e84d84ca7442867226fec84956388477d8c3f8f7e2ad807f72d7ff12a","observation_id":"9766aa76-9136-4664-8150-8ed9e13c65cc","resolution":{"observed_at":"2026-08-15T22:31:45.770099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09522","last_updated":"2018-06-24T13:55:48Z","snapshot_observed_at":"2026-08-14T19:32:30.606890Z","submitted_at":"2018-03-26T11:48:14Z","title":"A Provably Correct Algorithm for Deep Learning that Actually Works","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09522","snapshot_observed_at":"2026-08-15T22:31:44.180747Z","title":"Malach and S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.180747Z"},"links":{"cited_paper":"/paper/1803.09522","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ec375380901d0c29f7a1a3bd0bc58228a54aed091f8c0110bc468f45f0c9bd76","observation_id":"479cc6d5-e4a5-4edf-98e5-5000d7a11f09","resolution":{"observed_at":"2026-08-15T22:31:44.180747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.739286Z","title":"Malach and S","venue":null,"work_id":"0846739d-2eef-47b4-ac46-5a4e9b878454","year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.186553Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:7e5297855c477bc0ca84cbb3d35d86f475a759e3027984e107d9a49f20e00974","observation_id":"5652a916-3eae-401d-80a6-0ff4f9f4a6fa","resolution":{"observed_at":"2026-08-15T22:31:45.745424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.717278Z","title":"Cagnetta, L","venue":null,"work_id":"a6d54f28-74a8-4290-a70e-fe76bcae6043","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.191168Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:1de10b84647b644810c319f0095721ea488ff28e666e13100f83440ba76d71e9","observation_id":"f39e553a-4843-40fc-8e4c-bafac3bb9c1b","resolution":{"observed_at":"2026-08-15T22:31:45.723143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.700792Z","title":null,"venue":null,"work_id":"ea557bae-f572-4971-8c4b-866c1bacc00b","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.195722Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:eb8b44767f95bfd8f0fece3ec0f245e5b8831562e9b1888b0b85f691ac7ec778","observation_id":"bf9f4ad3-b045-4fd2-849a-15feac22077d","resolution":{"observed_at":"2026-08-15T22:31:45.705664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.678594Z","title":"Cagnetta and M","venue":null,"work_id":"5984add8-56b0-4958-a074-667348f55c49","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.201109Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:dfa97f898f607ee441b5757d712ba3ea3da043b02f90b86905d04c12edc0162b","observation_id":"5671c530-f596-427f-a93e-e0435df3f2b6","resolution":{"observed_at":"2026-08-15T22:31:45.684102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15138","last_updated":"2025-06-10T08:51:44Z","snapshot_observed_at":"2026-08-16T13:23:27.707681Z","submitted_at":"2024-08-27T15:23:09Z","title":"How transformers learn structured data: insights from hierarchical filtering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15138","snapshot_observed_at":"2026-08-15T22:31:44.205777Z","title":"Garnier-Brun, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.205777Z"},"links":{"cited_paper":"/paper/2408.15138","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:4e9f848df269e13f48d1303fd0e2bc72a9817ffb3f446bfc6b732326dce96117","observation_id":"a9706e87-a7e2-47e1-b4f7-9ef84d7938c6","resolution":{"observed_at":"2026-08-15T22:31:44.205777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.659020Z","title":"Sclocchi, A","venue":null,"work_id":"35a677f1-811b-4127-9976-a42a311b2de5","year":2025},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.210908Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:5f59f5913bd185f3b4891450e480af0bff2768cad636ec9c4f77087c238e53f7","observation_id":"647cdbbe-dd5b-4f89-8ba7-dad03ed257ef","resolution":{"observed_at":"2026-08-15T22:31:45.664565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.638536Z","title":"Sclocchi, A","venue":null,"work_id":"bcfa00de-7ad3-41e8-82fc-0e1e5c15dfcf","year":2025},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.215481Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:e3264779fdc9d931fdb89b73dff779833efa3660054cc08cd6104474b5d1b38a","observation_id":"60cee5d0-ec66-403d-8330-594dfc0d26bf","resolution":{"observed_at":"2026-08-15T22:31:45.643940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12089","last_updated":"2025-06-04T11:03:45Z","snapshot_observed_at":"2026-08-16T12:57:36.618017Z","submitted_at":"2025-02-17T18:06:33Z","title":"How Compositional Generalization and Creativity Improve as Diffusion Models are Trained","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12089","snapshot_observed_at":"2026-08-15T22:31:44.220322Z","title":"Favero, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.220322Z"},"links":{"cited_paper":"/paper/2502.12089","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ce4a3d0acc26e7d55a489f66c127fb419c08d826559f2aea3044965f2185978c","observation_id":"df958a18-7646-4620-8bfd-7cb80651b640","resolution":{"observed_at":"2026-08-15T22:31:44.220322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.618536Z","title":"Chomsky, Three models for the description of lan- guage, IRE Transactions on information theory 2, 113 (1956)","venue":null,"work_id":"395dd8ca-f19e-43d0-9c17-68ce8300c954","year":1956},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.225660Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:f92c5fbf52c4df483e21859a45df0bb665fed69e8516cd4b785290ee80416c7d","observation_id":"558c60e3-c2e5-4b56-bd48-83ef7f294915","resolution":{"observed_at":"2026-08-15T22:31:45.624313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04074","last_updated":"2021-02-08T09:25:31Z","snapshot_observed_at":"2026-08-16T18:47:05.682706Z","submitted_at":"2021-02-08T09:25:31Z","title":"Learning Curve Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04074","snapshot_observed_at":"2026-08-15T22:31:44.230213Z","title":"Hutter, Learning curve theory (2021), 13 arXiv:2102.04074 [cs.LG]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.230213Z"},"links":{"cited_paper":"/paper/2102.04074","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:4cbf8a8d71f664901ddbc256b0700956c5859cd5d7743a881823bcc767db7fc4","observation_id":"a3a3d9f8-177f-4929-ab37-b92a81cffdd3","resolution":{"observed_at":"2026-08-15T22:31:44.230213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.595817Z","title":null,"venue":null,"work_id":"a1c95c70-646b-4a20-af5c-3b54b50d163c","year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.235143Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:6aef0c2e555798b5c10690ab7d02f3418f49d4f3617722e8bc7a256bcfd07335","observation_id":"4cfce252-544f-49d5-b1d3-c2761f5cef16","resolution":{"observed_at":"2026-08-15T22:31:45.605100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.573644Z","title":"Caponnetto and E","venue":null,"work_id":"0bdb7374-5f0b-4219-b620-52c21be08363","year":2007},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.239982Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:0fc436070be2dd3f722554a3ddf399e9c4cc8cc78541ffdd93c6985c2221e7c8","observation_id":"24334a98-9002-4343-8244-07d4cb32ef41","resolution":{"observed_at":"2026-08-15T22:31:45.581714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.552464Z","title":"Spigler, M","venue":null,"work_id":"d6354a06-f4bd-4b9c-8687-7589aad7b896","year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.244603Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:f146a3b14bc061498168eb23e16a55d8975c85bc736b24866a6dc5f8d124bc10","observation_id":"5a959ab3-0771-4795-a22a-96f6c40abf54","resolution":{"observed_at":"2026-08-15T22:31:45.557676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.535771Z","title":"Bordelon, A","venue":null,"work_id":"d15074cd-63d6-47bc-a068-bfa7f3cab74e","year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.249104Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:a1092f065c1c1872b3a9a7a8ce5b33b977d255da1b69991062c0708ce9722c8c","observation_id":"b581b13e-761e-4a28-92b3-130e806fcec0","resolution":{"observed_at":"2026-08-15T22:31:45.540828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06701","last_updated":"2024-04-29T00:55:09Z","snapshot_observed_at":"2026-08-16T18:45:54.659137Z","submitted_at":"2021-02-12T18:57:46Z","title":"Explaining Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06701","snapshot_observed_at":"2026-08-15T22:31:44.253519Z","title":"Bahri, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.253519Z"},"links":{"cited_paper":"/paper/2102.06701","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:322e675883cd26db2542a35fb1c2c367c24e4a646e5aa5dcdc6661334baa3970","observation_id":"33e1b658-345c-40f5-a02d-ac511c5275ea","resolution":{"observed_at":"2026-08-15T22:31:44.253519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.514636Z","title":"Favero, F","venue":null,"work_id":"ccbc13a9-2aeb-4dd0-93e3-ae156fbbc2aa","year":2021},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.258410Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:606e2c24edcd64f5953af19089cb94f929ec0fe06cac8c7f3a4c6b48e7a352f6","observation_id":"a60bb6b9-bbc0-4fa9-8664-835698f53d76","resolution":{"observed_at":"2026-08-15T22:31:45.521283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.494981Z","title":null,"venue":null,"work_id":"cf4873b9-3341-46f1-9128-007186badddf","year":2021},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.263276Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:41cc234e26e1e5545b5854eadecb94648394091757d79574e82a888e1ae2f61b","observation_id":"98285d40-0c90-496b-b4ca-d074ce1e4514","resolution":{"observed_at":"2026-08-15T22:31:45.500884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-08-16T16:20:00.035540Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-15T22:31:44.267470Z","title":"Maloney, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.267470Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:107bd516592bcfa01a018c2d3a7ca22cb446482802de665f3a58207edbfea8ed","observation_id":"bfe9e1ff-cda3-4692-b595-1c04fda7e3d0","resolution":{"observed_at":"2026-08-15T22:31:44.267470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.474237Z","title":"Cagnetta, A","venue":null,"work_id":"78e0e728-6af8-46c7-8359-4b682a1a1b66","year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.271752Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:030c6f953afc7abc03e8bd07bbfd0bc82f80b957d61bf46aaa8f067c20dff673","observation_id":"c0c3820c-efe0-4c56-b71f-e2e5e0c736fa","resolution":{"observed_at":"2026-08-15T22:31:45.479254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.452723Z","title":"Bordelon, A","venue":null,"work_id":"aeb15f14-9279-4d5a-bebf-1f173ee36766","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.275954Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:142e1ab16111747c7e834d8ba51f76b2658b3d273af8e4a983249fad554aaa9a","observation_id":"939c3fe5-c6ac-46eb-a820-322bc0acf7d9","resolution":{"observed_at":"2026-08-15T22:31:45.458748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.437746Z","title":"Jacot, F","venue":null,"work_id":"b6318719-347d-47ed-ac88-a103aef18b50","year":2018},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.280017Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:b0ebc3808ea49fd0e5db29b0fabf4838b1eba5b777293a5d36b69e81cc9ec358","observation_id":"0849185a-0152-48d0-9697-a39560e21ca2","resolution":{"observed_at":"2026-08-15T22:31:45.441991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.422469Z","title":"Chizat, E","venue":null,"work_id":"c158a14e-411a-4219-9d58-2eba284448f4","year":2019},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.284186Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ceb6143eea1c8150c000f4de1086156c780cd4ede9f993c36ab6285a138610f9","observation_id":"151a625d-809a-4bc4-aef9-8a387d01c7db","resolution":{"observed_at":"2026-08-15T22:31:45.427439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.403813Z","title":"Paccolat, L","venue":null,"work_id":"e1e81b52-ea3d-492c-abc6-bb2d724850a3","year":2021},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.288312Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:eea8722ddc020066cecf4bc34b73d256481740cc10693447fb6097d9e502dbcf","observation_id":"4b215b59-3af0-4e62-bf10-c24d457dc32b","resolution":{"observed_at":"2026-08-15T22:31:45.410199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.384589Z","title":null,"venue":null,"work_id":"f9f8f0c7-1734-42de-b8d3-06fce6df884f","year":2022},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.292620Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:33649a2eff9f6cbb87402d0a3f2938798b669a7ec65356025237cd33008b3dc7","observation_id":"4753cb9d-db52-4aaf-9a65-51d1617656de","resolution":{"observed_at":"2026-08-15T22:31:45.390943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.367394Z","title":"Bietti, J","venue":null,"work_id":"d8161ecd-65a4-4889-b8f0-2b3c01cd1d70","year":2022},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.297862Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:916d8a99982dc1367802e8984369e125819f9d70a5e2fad96d6bd5df7a3bf5de","observation_id":"4f82725d-8f72-4594-a246-59cb1a02dc85","resolution":{"observed_at":"2026-08-15T22:31:45.372640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18270","last_updated":"2025-06-03T19:12:56Z","snapshot_observed_at":"2026-08-16T15:28:35.632341Z","submitted_at":"2023-05-29T17:43:44Z","title":"How Two-Layer Neural Networks Learn, One (Giant) Step at a Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18270","snapshot_observed_at":"2026-08-15T22:31:44.302827Z","title":"Dandi, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.302827Z"},"links":{"cited_paper":"/paper/2305.18270","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:57a908cc25d74b4f67db3c50afd5d6f5ddc269ee7377e311262151ee3490d1ba","observation_id":"c60ba2b1-93ef-4146-83f6-c0cc3b0a215c","resolution":{"observed_at":"2026-08-15T22:31:44.302827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.351377Z","title":"Bordelon, A","venue":null,"work_id":"f4bd7427-05a6-4f0b-bd6e-da05f6c9f5b5","year":2025},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.307757Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:f7732e13092efd91cd8045d3283935f210f5eaedaaf5008738568902702f3416","observation_id":"88047e31-246f-407a-9b6d-3c5f3b053296","resolution":{"observed_at":"2026-08-15T22:31:45.356306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.09057","last_updated":"2018-09-04T23:18:35Z","snapshot_observed_at":"2026-08-14T21:23:22.952525Z","submitted_at":"2016-12-29T07:26:26Z","title":"Deep Learning and Hierarchal Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.09057","snapshot_observed_at":"2026-08-15T22:31:44.312670Z","title":"Mossel, Deep learning and hierarchal generative mod- els, arXiv preprint arXiv:1612.09057 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.312670Z"},"links":{"cited_paper":"/paper/1612.09057","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:1e9300e1ebbbd18d242aab414de9065772aba9d18496d5f0fc9e952be6474e4c","observation_id":"779b1707-d9a2-46fc-9e7e-b5b015302940","resolution":{"observed_at":"2026-08-15T22:31:44.312670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18444","last_updated":"2024-05-01T16:49:57Z","snapshot_observed_at":"2026-08-17T01:26:32.989643Z","submitted_at":"2024-04-29T05:57:03Z","title":"U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18444","snapshot_observed_at":"2026-08-15T22:31:44.318560Z","title":"Mei, U-nets as belief propagation: Efficient classifica- tion, denoising, and diffusion in generative hierarchical models, arXiv preprint arXiv:2404.18444 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.318560Z"},"links":{"cited_paper":"/paper/2404.18444","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:d7e8d3b801a7bfd62e7393c1fecc3bea8f5b9d45f8b2df178606d0b73709ddbd","observation_id":"24e503dc-c7c6-4687-9857-e197085ce378","resolution":{"observed_at":"2026-08-15T22:31:44.318560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.335380Z","title":"Refinetti, A","venue":null,"work_id":"9fdcaff0-fe68-40b4-a02f-e4bb6189bfe6","year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.323919Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:106e3f8e6c97758d3dd292a3e9eb65953b7673b678f42bb2f38e181a9fe5b4fd","observation_id":"905c49a0-9b71-4d97-a0c5-7190cfd29a54","resolution":{"observed_at":"2026-08-15T22:31:45.340169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08602","last_updated":"2024-06-04T09:43:45Z","snapshot_observed_at":"2026-08-16T14:01:21.932750Z","submitted_at":"2024-04-12T17:01:25Z","title":"Sliding down the stairs: how correlated latent variables accelerate learning with neural networks","version":2},"cited_work":{"arxiv_id":"2404.08602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.08602","snapshot_observed_at":"2026-08-15T22:31:44.759882Z","title":"Sliding down the stairs: how correlated latent variables accelerate learning with neural networks","venue":"stat.ML","work_id":"bd8dcd33-fe9e-41a7-80e5-408d63e2e2e9","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.328740Z"},"links":{"cited_paper":"/paper/2404.08602","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ce27411ecd96595082922834cae7c8b2bd8dc8cbcfa3b2d9996b015f6e114372","observation_id":"18b73f4e-bcee-4438-9936-1d64268b7896","resolution":{"observed_at":"2026-08-15T22:31:44.766320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:44.333684Z","title":"Rende, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.333684Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:702472cfa4825f4cb393b7bda3a1018c1d7a4937a9743e79a315e3ac0ee2366d","observation_id":"4b0111b4-4bd1-497b-903d-86b7d9e0e21d","resolution":{"observed_at":"2026-08-15T22:31:44.333684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14994","last_updated":"2024-06-20T15:21:23Z","snapshot_observed_at":"2026-08-16T13:58:32.954473Z","submitted_at":"2024-04-23T12:51:37Z","title":"Transformers Can Represent $n$-gram Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14994","snapshot_observed_at":"2026-08-15T22:31:44.339444Z","title":"Svete and R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.339444Z"},"links":{"cited_paper":"/paper/2404.14994","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:67f1200f587af99382bfccb5b2dd2d7657beaee0274aac5ebeaa550e078d6cae","observation_id":"35763e32-4523-47cb-b442-5b0f433e6f36","resolution":{"observed_at":"2026-08-15T22:31:44.339444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.319652Z","title":"Nguyen, Understanding transformers via n-gram statistics, in The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024)","venue":null,"work_id":"248e8b40-f555-4573-bd5d-a193fdc782f0","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.344875Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:5a3591cc79dbd5a7192a417b6ed8936659de86eac616e765e2feefe21c903b7a","observation_id":"91f5f53a-83a7-42bf-af5c-a76e9afdda4d","resolution":{"observed_at":"2026-08-15T22:31:45.324660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03001","last_updated":"2024-10-03T21:21:02Z","snapshot_observed_at":"2026-08-16T13:12:46.887083Z","submitted_at":"2024-10-03T21:21:02Z","title":"Can Transformers Learn $n$-gram Language Models?","version":1},"cited_work":{"arxiv_id":"2410.03001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03001","snapshot_observed_at":"2026-08-15T22:31:44.637242Z","title":"Can Transformers Learn $n$-gram Language Models?","venue":"cs.CL","work_id":"e8146dad-9afd-47a7-9045-3d010b580e6d","year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.349671Z"},"links":{"cited_paper":"/paper/2410.03001","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:d7859ddc81910dc445212efd4bf3215f2bc9506a2434c9c07d59138b98c55a3a","observation_id":"c118f06a-f8eb-4d26-a943-ad07fefd38c5","resolution":{"observed_at":"2026-08-15T22:31:44.645358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04289","last_updated":"2025-01-12T15:43:54Z","snapshot_observed_at":"2026-08-16T13:45:25.885980Z","submitted_at":"2024-06-06T17:34:24Z","title":"What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04289","snapshot_observed_at":"2026-08-15T22:31:44.354728Z","title":"Borenstein, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.354728Z"},"links":{"cited_paper":"/paper/2406.04289","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:6ecb9f014fa02a2396ce78b768475d30cb69af67466098e5811c71252588e879","observation_id":"92c44b42-8982-402b-8c32-bb0fd9cc5267","resolution":{"observed_at":"2026-08-15T22:31:44.354728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15943","last_updated":"2025-02-04T03:38:57Z","snapshot_observed_at":"2026-08-16T13:49:35.878650Z","submitted_at":"2024-05-24T21:14:10Z","title":"Transformers represent belief state geometry in their residual stream","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15943","snapshot_observed_at":"2026-08-15T22:31:44.361122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.361122Z"},"links":{"cited_paper":"/paper/2405.15943","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ebbd412355a28ca9467e3f846fc69ff08577e6af3fe3cb2d51ce0c7a07f4d61e","observation_id":"9820c7e9-87a7-4175-9456-8aeba7db20e4","resolution":{"observed_at":"2026-08-15T22:31:44.361122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-16T15:30:48.952049Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-15T22:31:44.366162Z","title":"Allen-Zhu and Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.366162Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:22adf7aad0b71b80e56cc7c42e4f6e68a58f8a7698c08a9a00afb12602011f87","observation_id":"417ba520-523b-4020-b63a-ce17a74736ab","resolution":{"observed_at":"2026-08-15T22:31:44.366162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08117","last_updated":"2023-10-16T03:27:53Z","snapshot_observed_at":"2026-08-16T15:48:14.670853Z","submitted_at":"2023-03-14T17:49:50Z","title":"Do Transformers Parse while Predicting the Masked Word?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08117","snapshot_observed_at":"2026-08-15T22:31:44.371041Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.371041Z"},"links":{"cited_paper":"/paper/2303.08117","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:b5abd95edbe585bb4f68cfee1bf609127a1ba5bba5055db1844cbf72a7314c77","observation_id":"3f1aa468-9db2-45c9-9c02-7be0ca47f448","resolution":{"observed_at":"2026-08-15T22:31:44.371041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.303815Z","title":null,"venue":null,"work_id":"15bf60fd-6baf-47ea-9f02-dfed2239066c","year":2020},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.376275Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:a41f19a4782b23e5e0140be24bd91331cafe4676154da1992f7c2644ac769b0b","observation_id":"db6ce586-838c-4076-b9bc-004a6b85c1cd","resolution":{"observed_at":"2026-08-15T22:31:45.308857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16367","last_updated":"2025-03-16T05:23:12Z","snapshot_observed_at":"2026-08-16T13:58:00.214064Z","submitted_at":"2024-04-25T07:10:29Z","title":"Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16367","snapshot_observed_at":"2026-08-15T22:31:44.381397Z","title":"Ahuja, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.381397Z"},"links":{"cited_paper":"/paper/2404.16367","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:fd318fd2619ec0b955c47ea0dac10efc96d720f0ca78ca0363d1237016d350b5","observation_id":"3225ba8b-4e5a-45da-ac93-4d6f22a9ecfd","resolution":{"observed_at":"2026-08-15T22:31:44.381397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.286337Z","title":"Rozenberg and A","venue":null,"work_id":"74870e2b-5d7e-4d7d-9e1d-a252052208b1","year":1997},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.386360Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:2df6f3a534eb89d1f68bb3e4e47e6c8aae406a743a474f5a4df47526253c6ff6","observation_id":"b2276bf5-d551-4cbc-83d8-c3dcf424d8c9","resolution":{"observed_at":"2026-08-15T22:31:45.291589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.270250Z","title":null,"venue":null,"work_id":"68103964-e65f-4441-bb2d-9a1c343233ba","year":1982},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.391352Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:7ab35debbc65280005b5969be6b1c713ee8554a700a1a4e02f5ff30fd2830580","observation_id":"75946625-11d7-4e1b-8c4c-e146ad7afe8e","resolution":{"observed_at":"2026-08-15T22:31:45.274565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.253173Z","title":null,"venue":null,"work_id":"b4505dac-31d8-41a5-b556-0c550def670c","year":1985},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.395809Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:dd80f6405bd755b413da71e263f0c697ad4b3b9354a0e2ec6d5b567c72bb47cb","observation_id":"1b5844e8-17a4-468b-a985-9abeccec6d68","resolution":{"observed_at":"2026-08-15T22:31:45.258772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.237862Z","title":null,"venue":null,"work_id":"500b6c4f-45e1-4883-a5dc-fb5afb0ac345","year":1999},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.400165Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:02433bd67aaff78424440e5f3fb5f9b224e3cbba55eae42ad7cc7783589f9126","observation_id":"0ed7ca43-34e8-46ce-80b4-a94217de5fce","resolution":{"observed_at":"2026-08-15T22:31:45.242377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.217293Z","title":"Zhu and D","venue":null,"work_id":"125e0099-d3aa-4e1f-9cf8-2716407c94ec","year":2006},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.404296Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:1c90667b05cc2459e5967c4f069c854298e6b1b12d3cb19c3d63d1f906cf2e31","observation_id":"b2b72171-38ee-4e9c-8005-26b41b815c4b","resolution":{"observed_at":"2026-08-15T22:31:45.223408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.200334Z","title":"Ebeling and T","venue":null,"work_id":"64b56f7b-9ad2-41a7-98f9-fd3a453921f1","year":1994},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.410024Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:644124690c0e91fde3f7cc98b61ab9c9460a8060ffe4f4814926e39b2e9d5391","observation_id":"d50267ef-7333-4787-a147-56983b52fa5e","resolution":{"observed_at":"2026-08-15T22:31:45.205206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:44.415026Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.415026Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:e936360da2da8b7e34ce14878f4943bad8ed49bdf61b03836166d24517f33ec7","observation_id":"e6e98d0e-9066-49ba-98f7-b946b4f77046","resolution":{"observed_at":"2026-08-15T22:31:44.415026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:44.419998Z","title":"Mezard and A","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.419998Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:d69538307453c0020297e4f5242ee82460b1b6067c3b4f91d8380825be0838d7","observation_id":"718b5131-4eda-4ff3-b4db-93dbb2b10a19","resolution":{"observed_at":"2026-08-15T22:31:44.419998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.173271Z","title":null,"venue":null,"work_id":"5a69da55-bd11-410e-8fd3-15a810d114a4","year":2012},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.424870Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:63a6f1110683b8aadca70e2f37c423b89cc4e4f0c497755fb71de8831b6a0e29","observation_id":"adead80c-0555-4770-9b7e-1186f214dbf0","resolution":{"observed_at":"2026-08-15T22:31:45.178069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.156493Z","title":"DeGiuli, Random language model, Phys","venue":null,"work_id":"18c87169-7067-4157-b548-93c503384154","year":2019},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.429591Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:f04bd426c9fc48159f5047c075ce61fd15e3954844d7e9cf1199a7136f941364","observation_id":"2bbafcbc-47aa-46e4-b211-3310599cdc60","resolution":{"observed_at":"2026-08-15T22:31:45.161635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.138018Z","title":"Devlin, M.-W","venue":null,"work_id":"2471ce3c-6dc7-4d4f-b1f1-597ef78b0244","year":2019},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.435316Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:c207728a22e800b277728d8c5a6c482bc0d37d1aa615b8b5a7515b69ff1444a8","observation_id":"a86a3215-3802-4148-b2af-b5bd9691245d","resolution":{"observed_at":"2026-08-15T22:31:45.143637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.118380Z","title":"Radford, K","venue":null,"work_id":"1a1370f5-36e9-47b9-838b-0b894e8ecd30","year":2018},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.442007Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:42d8f23a053627ee0dd7da7270a5b6f4891f983f9d0f1a54ddb906767d1a8059","observation_id":"a1fadc9b-ce98-413a-b696-b8a0fb178a9f","resolution":{"observed_at":"2026-08-15T22:31:45.124825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:44.447056Z","title":"LeCun, B","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.447056Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:d2859e683b0ff72e1fb796425be322f8cac5ea01517b13f64a4efbaf6edadb6d","observation_id":"a3fb775c-9465-4ef1-9fbe-da234e5b96d9","resolution":{"observed_at":"2026-08-15T22:31:44.447056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.2188","last_updated":"2014-04-08T15:46:44Z","snapshot_observed_at":"2026-08-16T12:52:35.699791Z","submitted_at":"2014-04-08T15:46:44Z","title":"A Convolutional Neural Network for Modelling Sentences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.2188","snapshot_observed_at":"2026-08-15T22:31:44.453146Z","title":"Kalchbrenner, E","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.453146Z"},"links":{"cited_paper":"/paper/1404.2188","citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:144cadeb586e6241c505a385aa1defcd2c860ce4fbb22d5f53cc6db6ac50a790","observation_id":"ee763a8b-3754-463a-8e53-9121f97f1d0a","resolution":{"observed_at":"2026-08-15T22:31:44.453146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:45.067983Z","title":null,"venue":null,"work_id":"dffd533e-6161-4326-9d3a-9d903a1b1300","year":2014},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.458647Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ba675476515fdb21415a8d24a85bb0b6b5cb82459dff459fdcab70d01128ccf6","observation_id":"96943c8e-cbf0-4634-ad49-1ed6030b2dfe","resolution":{"observed_at":"2026-08-15T22:31:45.073527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:31:44.464243Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:31:44.464243Z"},"links":{"citing_paper":"/paper/2505.07070"},"observation_digest":"sha256:ae0df381b8c6e77bea4c1e339eb4dc74a0c29c4df7ab65d16be9128b19738427","observation_id":"fd4b5fa6-b9e3-413b-a43b-0cf49d43d5ac","resolution":{"observed_at":"2026-08-15T22:31:44.464243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07070","last_updated":"2025-05-11T17:44:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T22:23:33.725897Z","submitted_at":"2025-05-11T17:44:14Z","title":"Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2505.07070."}