Pith. sign in

Paper Citation Record · LEDGER

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures

As of 17 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2505.07070.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.07070 v1

Coverage vector

measured 67 of 67 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:31:44.464243Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T14:02:56.648836Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T08:43:15.231264Z

Reference resolution

67 of 67 outbound references displayed

  • verified exact2
  • verified fuzzy28
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f9620582-b90a-4f23-b3d9-3ee458305c03 · outbound

This paper cites These correlations are given by the fol- lowing (vm)×v C(X−t,X−1)µ,ν :=P{X−t =µ,X−1 =ν} − P{X−t =µ} P{X−1 =ν}.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures These correlations are given by the fol- lowing (vm)×v C(X−t,X−1)µ,ν :=P{X−t =µ,X−1 =ν} − P{X−t =µ} P{X−1 =ν}

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.831027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.139930Z digest=sha256:1b24e1eabe3c96b15f26e10be1ae01df270ed164cf5e3628e84987258d271ce6

Observation f3556d56-50e0-49d3-b6ad-c5d28707de41 · outbound

This paper cites These tuples have a smaller tree dis- tance from X−1 than tuples of input tokens, thus the corresponding sample complexities are lower than those required by Eq.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures These tuples have a smaller tree dis- tance from X−1 than tuples of input tokens, thus the corresponding sample complexities are lower than those required by Eq

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.811345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.144578Z digest=sha256:6a93dee43b7521f66d9bbcafd351886f294e0c17035d7ebd5337ea0ade774dfa

Observation b45de51a-e311-4bca-9866-dfb743831000 · outbound

This paper cites Therefore, a learner could infer all level- L latents 7 as soon as it’s able to infer µ (L) −2, which is the easiest to infer as it has the strongest correlation with X−1.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Therefore, a learner could infer all level- L latents 7 as soon as it’s able to infer µ (L) −2, which is the easiest to infer as it has the strongest correlation with X−1

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.792772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.149055Z digest=sha256:2a22d5e5796563a31f4be8b6409b70165f828616a7152a4d782f18a914a90cf8

Observation 0da5e4c7-762c-4326-b1ee-3adeac97ada5 · outbound

This paper cites Training Compute-Optimal Large Language Models.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Training Compute-Optimal Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.170303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.170303Z digest=sha256:f905bb70ab559b33a11013536216686195aacc5f32d67d3bc50fdbd96ef79ee9

Observation 21fd111c-2f48-42ae-9a06-03b4460cab0e · outbound

This paper cites Deep Learning Scaling is Predictable, Empirically.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Deep Learning Scaling is Predictable, Empirically

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.154778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.154778Z digest=sha256:fce93b1368cf4fcbed11bf32ec396f9318a402cc9be041bb44bad47e4b0073a0

Observation f942c378-591d-4928-8f36-49f760bfc7c3 · outbound

This paper cites Scaling Laws for Neural Language Models.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Scaling Laws for Neural Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.160078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.160078Z digest=sha256:8c74f377d919d97a447fa254fa4077c039a5e32b500552bc7785d60e538ce2f5

Observation a70d5954-3680-4b59-bae7-559f0a4f200e · outbound

This paper cites Scaling Laws for Autoregressive Generative Modeling.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Scaling Laws for Autoregressive Generative Modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.165225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.165225Z digest=sha256:9525d9f4a009ad2eb84b28fbf3c499eca4200f279f89578bc79f28b261aada85

Observation 6507dd54-7b49-45ac-9420-0c5d0e63cee1 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.849248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.133951Z digest=sha256:db42b33bca3a22b395f81a88fb4bd021a756117d4498032a0dd5a83504043631

Observation 9766aa76-9136-4664-8150-8ed9e13c65cc · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.770099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.176083Z digest=sha256:ed3bd26e84d84ca7442867226fec84956388477d8c3f8f7e2ad807f72d7ff12a

Observation 479cc6d5-e4a5-4edf-98e5-5000d7a11f09 · outbound

This paper cites A Provably Correct Algorithm for Deep Learning that Actually Works.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures A Provably Correct Algorithm for Deep Learning that Actually Works

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.180747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.180747Z digest=sha256:ec375380901d0c29f7a1a3bd0bc58228a54aed091f8c0110bc468f45f0c9bd76

Observation 5652a916-3eae-401d-80a6-0ff4f9f4a6fa · outbound

This paper cites Malach and S.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Malach and S

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.745424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.186553Z digest=sha256:7e5297855c477bc0ca84cbb3d35d86f475a759e3027984e107d9a49f20e00974

Observation f39e553a-4843-40fc-8e4c-bafac3bb9c1b · outbound

This paper cites Cagnetta, L.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Cagnetta, L

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.723143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.191168Z digest=sha256:1de10b84647b644810c319f0095721ea488ff28e666e13100f83440ba76d71e9

Observation bf9f4ad3-b045-4fd2-849a-15feac22077d · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.705664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.195722Z digest=sha256:eb8b44767f95bfd8f0fece3ec0f245e5b8831562e9b1888b0b85f691ac7ec778

Observation 5671c530-f596-427f-a93e-e0435df3f2b6 · outbound

This paper cites Cagnetta and M.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Cagnetta and M

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.684102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.201109Z digest=sha256:dfa97f898f607ee441b5757d712ba3ea3da043b02f90b86905d04c12edc0162b

Observation a9706e87-a7e2-47e1-b4f7-9ef84d7938c6 · outbound

This paper cites How transformers learn structured data: insights from hierarchical filtering.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures How transformers learn structured data: insights from hierarchical filtering

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.205777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.205777Z digest=sha256:4e9f848df269e13f48d1303fd0e2bc72a9817ffb3f446bfc6b732326dce96117

Observation 647cdbbe-dd5b-4f89-8ba7-dad03ed257ef · outbound

This paper cites Sclocchi, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Sclocchi, A

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.664565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.210908Z digest=sha256:5f59f5913bd185f3b4891450e480af0bff2768cad636ec9c4f77087c238e53f7

Observation 60cee5d0-ec66-403d-8330-594dfc0d26bf · outbound

This paper cites Sclocchi, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Sclocchi, A

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.643940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.215481Z digest=sha256:e3264779fdc9d931fdb89b73dff779833efa3660054cc08cd6104474b5d1b38a

Observation df958a18-7646-4620-8bfd-7cb80651b640 · outbound

This paper cites How Compositional Generalization and Creativity Improve as Diffusion Models are Trained.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures How Compositional Generalization and Creativity Improve as Diffusion Models are Trained

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.220322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.220322Z digest=sha256:ce4a3d0acc26e7d55a489f66c127fb419c08d826559f2aea3044965f2185978c

Observation 558c60e3-c2e5-4b56-bd48-83ef7f294915 · outbound

This paper cites Chomsky, Three models for the description of lan- guage, IRE Transactions on information theory 2, 113 (1956).

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Chomsky, Three models for the description of lan- guage, IRE Transactions on information theory 2, 113 (1956)

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.624313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.225660Z digest=sha256:f92c5fbf52c4df483e21859a45df0bb665fed69e8516cd4b785290ee80416c7d

Observation a3a3d9f8-177f-4929-ab37-b92a81cffdd3 · outbound

This paper cites Learning Curve Theory.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Learning Curve Theory

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.230213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.230213Z digest=sha256:4cbf8a8d71f664901ddbc256b0700956c5859cd5d7743a881823bcc767db7fc4

Observation 4cfce252-544f-49d5-b1d3-c2761f5cef16 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.605100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.235143Z digest=sha256:6aef0c2e555798b5c10690ab7d02f3418f49d4f3617722e8bc7a256bcfd07335

Observation 24334a98-9002-4343-8244-07d4cb32ef41 · outbound

This paper cites Caponnetto and E.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Caponnetto and E

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.581714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.239982Z digest=sha256:0fc436070be2dd3f722554a3ddf399e9c4cc8cc78541ffdd93c6985c2221e7c8

Observation 5a959ab3-0771-4795-a22a-96f6c40abf54 · outbound

This paper cites Spigler, M.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Spigler, M

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.557676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.244603Z digest=sha256:f146a3b14bc061498168eb23e16a55d8975c85bc736b24866a6dc5f8d124bc10

Observation b581b13e-761e-4a28-92b3-130e806fcec0 · outbound

This paper cites Bordelon, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Bordelon, A

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.540828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.249104Z digest=sha256:a1092f065c1c1872b3a9a7a8ce5b33b977d255da1b69991062c0708ce9722c8c

Observation 33e1b658-345c-40f5-a02d-ac511c5275ea · outbound

This paper cites Explaining Neural Scaling Laws.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Explaining Neural Scaling Laws

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.253519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.253519Z digest=sha256:322e675883cd26db2542a35fb1c2c367c24e4a646e5aa5dcdc6661334baa3970

Observation a60bb6b9-bbc0-4fa9-8664-835698f53d76 · outbound

This paper cites Favero, F.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Favero, F

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.521283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.258410Z digest=sha256:606e2c24edcd64f5953af19089cb94f929ec0fe06cac8c7f3a4c6b48e7a352f6

Observation 98285d40-0c90-496b-b4ca-d074ce1e4514 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.500884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.263276Z digest=sha256:41cc234e26e1e5545b5854eadecb94648394091757d79574e82a888e1ae2f61b

Observation bfe9e1ff-cda3-4692-b595-1c04fda7e3d0 · outbound

This paper cites A Solvable Model of Neural Scaling Laws.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures A Solvable Model of Neural Scaling Laws

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.267470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.267470Z digest=sha256:107bd516592bcfa01a018c2d3a7ca22cb446482802de665f3a58207edbfea8ed

Observation c0c3820c-efe0-4c56-b71f-e2e5e0c736fa · outbound

This paper cites Cagnetta, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Cagnetta, A

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.479254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.271752Z digest=sha256:030c6f953afc7abc03e8bd07bbfd0bc82f80b957d61bf46aaa8f067c20dff673

Observation 939c3fe5-c6ac-46eb-a820-322bc0acf7d9 · outbound

This paper cites Bordelon, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Bordelon, A

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.458748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.275954Z digest=sha256:142e1ab16111747c7e834d8ba51f76b2658b3d273af8e4a983249fad554aaa9a

Observation 0849185a-0152-48d0-9697-a39560e21ca2 · outbound

This paper cites Jacot, F.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Jacot, F

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.441991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.280017Z digest=sha256:b0ebc3808ea49fd0e5db29b0fabf4838b1eba5b777293a5d36b69e81cc9ec358

Observation 151a625d-809a-4bc4-aef9-8a387d01c7db · outbound

This paper cites Chizat, E.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Chizat, E

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.427439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.284186Z digest=sha256:ceb6143eea1c8150c000f4de1086156c780cd4ede9f993c36ab6285a138610f9

Observation 4b215b59-3af0-4e62-bf10-c24d457dc32b · outbound

This paper cites Paccolat, L.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Paccolat, L

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.410199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.288312Z digest=sha256:eea8722ddc020066cecf4bc34b73d256481740cc10693447fb6097d9e502dbcf

Observation 4753cb9d-db52-4aaf-9a65-51d1617656de · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.390943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.292620Z digest=sha256:33649a2eff9f6cbb87402d0a3f2938798b669a7ec65356025237cd33008b3dc7

Observation 4f82725d-8f72-4594-a246-59cb1a02dc85 · outbound

This paper cites Bietti, J.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Bietti, J

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.372640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.297862Z digest=sha256:916d8a99982dc1367802e8984369e125819f9d70a5e2fad96d6bd5df7a3bf5de

Observation c60ba2b1-93ef-4146-83f6-c0cc3b0a215c · outbound

This paper cites How Two-Layer Neural Networks Learn, One (Giant) Step at a Time.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures How Two-Layer Neural Networks Learn, One (Giant) Step at a Time

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.302827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.302827Z digest=sha256:57a908cc25d74b4f67db3c50afd5d6f5ddc269ee7377e311262151ee3490d1ba

Observation 88047e31-246f-407a-9b6d-3c5f3b053296 · outbound

This paper cites Bordelon, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Bordelon, A

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.356306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.307757Z digest=sha256:f7732e13092efd91cd8045d3283935f210f5eaedaaf5008738568902702f3416

Observation 779b1707-d9a2-46fc-9e7e-b5b015302940 · outbound

This paper cites Deep Learning and Hierarchal Generative Models.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Deep Learning and Hierarchal Generative Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.312670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.312670Z digest=sha256:1e9300e1ebbbd18d242aab414de9065772aba9d18496d5f0fc9e952be6474e4c

Observation 24e503dc-c7c6-4687-9857-e197085ce378 · outbound

This paper cites U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.318560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.318560Z digest=sha256:d7e8d3b801a7bfd62e7393c1fecc3bea8f5b9d45f8b2df178606d0b73709ddbd

Observation 905c49a0-9b71-4d97-a0c5-7190cfd29a54 · outbound

This paper cites Refinetti, A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Refinetti, A

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.340169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.323919Z digest=sha256:106e3f8e6c97758d3dd292a3e9eb65953b7673b678f42bb2f38e181a9fe5b4fd

Observation 18b73f4e-bcee-4438-9936-1d64268b7896 · outbound

This paper cites Sliding down the stairs: how correlated latent variables accelerate learning with neural networks.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Sliding down the stairs: how correlated latent variables accelerate learning with neural networks

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-08-15T22:31:44.766320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.328740Z digest=sha256:ce27411ecd96595082922834cae7c8b2bd8dc8cbcfa3b2d9996b015f6e114372

Observation 4b0111b4-4bd1-497b-903d-86b7d9e0e21d · outbound

This paper cites Rende, F.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Rende, F

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.333684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.333684Z digest=sha256:702472cfa4825f4cb393b7bda3a1018c1d7a4937a9743e79a315e3ac0ee2366d

Observation 35763e32-4523-47cb-b442-5b0f433e6f36 · outbound

This paper cites Transformers Can Represent $n$-gram Language Models.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Transformers Can Represent $n$-gram Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.339444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.339444Z digest=sha256:67f1200f587af99382bfccb5b2dd2d7657beaee0274aac5ebeaa550e078d6cae

Observation 91f5f53a-83a7-42bf-af5c-a76e9afdda4d · outbound

This paper cites Nguyen, Understanding transformers via n-gram statistics, in The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024).

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Nguyen, Understanding transformers via n-gram statistics, in The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024)

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.324660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.344875Z digest=sha256:5a3591cc79dbd5a7192a417b6ed8936659de86eac616e765e2feefe21c903b7a

Observation c118f06a-f8eb-4d26-a943-ad07fefd38c5 · outbound

This paper cites Can Transformers Learn $n$-gram Language Models?.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Can Transformers Learn $n$-gram Language Models?

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-08-15T22:31:44.645358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.349671Z digest=sha256:d7859ddc81910dc445212efd4bf3215f2bc9506a2434c9c07d59138b98c55a3a

Observation 92c44b42-8982-402b-8c32-bb0fd9cc5267 · outbound

This paper cites What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.354728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.354728Z digest=sha256:6ecb9f014fa02a2396ce78b768475d30cb69af67466098e5811c71252588e879

Observation 9820c7e9-87a7-4175-9456-8aeba7db20e4 · outbound

This paper cites Transformers represent belief state geometry in their residual stream.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Transformers represent belief state geometry in their residual stream

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.361122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.361122Z digest=sha256:ebbd412355a28ca9467e3f846fc69ff08577e6af3fe3cb2d51ce0c7a07f4d61e

Observation 417ba520-523b-4020-b63a-ce17a74736ab · outbound

This paper cites Physics of Language Models: Part 1, Learning Hierarchical Language Structures.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Physics of Language Models: Part 1, Learning Hierarchical Language Structures

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.366162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.366162Z digest=sha256:22adf7aad0b71b80e56cc7c42e4f6e68a58f8a7698c08a9a00afb12602011f87

Observation 3f1aa468-9db2-45c9-9c02-7be0ca47f448 · outbound

This paper cites Do Transformers Parse while Predicting the Masked Word?.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Do Transformers Parse while Predicting the Masked Word?

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.371041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.371041Z digest=sha256:b5abd95edbe585bb4f68cfee1bf609127a1ba5bba5055db1844cbf72a7314c77

Observation db6ce586-838c-4076-b9bc-004a6b85c1cd · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.308857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.376275Z digest=sha256:a41f19a4782b23e5e0140be24bd91331cafe4676154da1992f7c2644ac769b0b

Observation 3225ba8b-4e5a-45da-ac93-4d6f22a9ecfd · outbound

This paper cites Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.381397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.381397Z digest=sha256:fd318fd2619ec0b955c47ea0dac10efc96d720f0ca78ca0363d1237016d350b5

Observation b2276bf5-d551-4cbc-83d8-c3dcf424d8c9 · outbound

This paper cites Rozenberg and A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Rozenberg and A

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.291589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.386360Z digest=sha256:2df6f3a534eb89d1f68bb3e4e47e6c8aae406a743a474f5a4df47526253c6ff6

Observation 75946625-11d7-4e1b-8c4c-e146ad7afe8e · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.274565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.391352Z digest=sha256:7ab35debbc65280005b5969be6b1c713ee8554a700a1a4e02f5ff30fd2830580

Observation 1b5844e8-17a4-468b-a985-9abeccec6d68 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.258772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.395809Z digest=sha256:dd80f6405bd755b413da71e263f0c697ad4b3b9354a0e2ec6d5b567c72bb47cb

Observation 0ed7ca43-34e8-46ce-80b4-a94217de5fce · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.242377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.400165Z digest=sha256:02433bd67aaff78424440e5f3fb5f9b224e3cbba55eae42ad7cc7783589f9126

Observation b2b72171-38ee-4e9c-8005-26b41b815c4b · outbound

This paper cites Zhu and D.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Zhu and D

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.223408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.404296Z digest=sha256:1c90667b05cc2459e5967c4f069c854298e6b1b12d3cb19c3d63d1f906cf2e31

Observation d50267ef-7333-4787-a147-56983b52fa5e · outbound

This paper cites Ebeling and T.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Ebeling and T

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.205206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.410024Z digest=sha256:644124690c0e91fde3f7cc98b61ab9c9460a8060ffe4f4814926e39b2e9d5391

Observation e6e98d0e-9066-49ba-98f7-b946b4f77046 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.415026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.415026Z digest=sha256:e936360da2da8b7e34ce14878f4943bad8ed49bdf61b03836166d24517f33ec7

Observation 718b5131-4eda-4ff3-b4db-93dbb2b10a19 · outbound

This paper cites Mezard and A.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Mezard and A

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.419998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.419998Z digest=sha256:d69538307453c0020297e4f5242ee82460b1b6067c3b4f91d8380825be0838d7

Observation adead80c-0555-4770-9b7e-1186f214dbf0 · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 60

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.178069Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.424870Z digest=sha256:63a6f1110683b8aadca70e2f37c423b89cc4e4f0c497755fb71de8831b6a0e29

Observation 2bbafcbc-47aa-46e4-b211-3310599cdc60 · outbound

This paper cites DeGiuli, Random language model, Phys.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures DeGiuli, Random language model, Phys

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.161635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.429591Z digest=sha256:f04bd426c9fc48159f5047c075ce61fd15e3954844d7e9cf1199a7136f941364

Observation a86a3215-3802-4148-b2af-b5bd9691245d · outbound

This paper cites Devlin, M.-W.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Devlin, M.-W

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.143637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.435316Z digest=sha256:c207728a22e800b277728d8c5a6c482bc0d37d1aa615b8b5a7515b69ff1444a8

Observation a1fadc9b-ce98-413a-b696-b8a0fb178a9f · outbound

This paper cites Radford, K.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Radford, K

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T22:31:45.124825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.442007Z digest=sha256:42d8f23a053627ee0dd7da7270a5b6f4891f983f9d0f1a54ddb906767d1a8059

Observation a3fb775c-9465-4ef1-9fbe-da234e5b96d9 · outbound

This paper cites LeCun, B.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures LeCun, B

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.447056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.447056Z digest=sha256:d2859e683b0ff72e1fb796425be322f8cac5ea01517b13f64a4efbaf6edadb6d

Observation ee763a8b-3754-463a-8e53-9121f97f1d0a · outbound

This paper cites A Convolutional Neural Network for Modelling Sentences.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures A Convolutional Neural Network for Modelling Sentences

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.453146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.453146Z digest=sha256:144cadeb586e6241c505a385aa1defcd2c860ce4fbb22d5f53cc6db6ac50a790

Observation 96943c8e-cbf0-4634-ad49-1ed6030b2dfe · outbound

This paper cites an unresolved cited work.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-15T22:31:45.073527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T22:31:44.458647Z digest=sha256:ba675476515fdb21415a8d24a85bb0b6b5cb82459dff459fdcab70d01128ccf6

Observation fd4b5fa6-b9e3-413b-a43b-0cf49d43d5ac · outbound

This paper cites Vaswani, N.

Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures Vaswani, N

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-15T22:31:44.464243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:31:44.464243Z digest=sha256:ae0df381b8c6e77bea4c1e339eb4dc74a0c29c4df7ab65d16be9128b19738427

Pith citing papers

Observation 2b9d6123-39db-4799-bfff-b3f51a7b958b · inbound

Unifying Learning Dynamics and Generalization in Transformers Scaling Law cites this paper.

Unifying Learning Dynamics and Generalization in Transformers Scaling Law Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures

Reference 2007

Resolution
unresolved
no resolver link, observed 2026-08-03T14:02:56.648836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:02:56.648836Z digest=sha256:27b2a92f895197afe4e6c9c30881f6f152365b7ebc2103e3c234a2f5302d558b

Observation 06b7a6b0-124c-467f-a929-7bacaa79ff39 · inbound

Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention cites this paper.

Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention Scaling Laws and Representation Learning in Simple Hierarchical Languages: Transformers vs. Convolutional Architectures

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:43:15.232804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-29T08:39:14.327838Z digest=sha256:42e216b0f1fdb1ee2ad9f3e4b773e99511ccabba0e87520eff26540f589a9b7d