{"as_of":"2026-08-16T00:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7ef0adb17977a07d4818b09f568c597ee20e5f2b5335e785e47344adcf90fd6","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:28:35.859983Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T05:08:00.711576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:38:40.636427Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"cited_work":{"arxiv_id":"2602.20555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20555","snapshot_observed_at":"2026-07-29T02:24:15.834827Z","title":"[46]Lai, Y., and Sun, D.Standard transformers achieve the minimax rate in nonparametric regression withC s,λ targets.arXiv e-prints(2026), arXiv:2602.20555","venue":null,"work_id":"88261e55-9bbf-4309-955e-0d77a7905ca9","year":2025},"citing_paper":{"arxiv_id":"2606.13280","last_updated":"2026-06-11T12:34:47Z","snapshot_observed_at":"2026-08-01T22:00:47.870974Z","submitted_at":"2026-06-11T12:34:47Z","title":"Generalization Bounds for Transformer-Based Next-Token Prediction in a Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T05:08:00.711576Z"},"links":{"cited_paper":"/paper/2602.20555","citing_paper":"/paper/2606.13280"},"observation_digest":"sha256:6bf81f92af1445e42233be73c9a4fbb91dca423d766991a0f6b19d0f3dd10590","observation_id":"68c41094-657e-4173-97e4-2c0684c89151","resolution":{"observed_at":"2026-07-29T02:24:15.834827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.20555/citation-record","integrity":"/paper/2602.20555/integrity","json":"/paper/2602.20555/citation-record.json","paper":"/paper/2602.20555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.605327Z","title":"Pearson, 2 edition, 1974","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.605327Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6c506f5fbce14f5b5dc1cdd806fd5d5fb1330202fa0b1322c4d4206e233d908b","observation_id":"2e501e7c-54b3-422f-bb71-a1e2a5cf5896","resolution":{"observed_at":"2026-08-02T21:28:27.605327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.662144Z","title":"Low-rank bottleneck in multi-head attention models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.662144Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:bf68d4bb9921689dc46ed3f001884fe25e300dc1cfe60001385e15046d0908bb","observation_id":"2cb93dd9-59ed-4fef-814b-6c73a60efb61","resolution":{"observed_at":"2026-08-02T21:28:27.662144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.738468Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.738468Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:39ea34bb3935a298e03e3e064ed541560096d3d3c02d91da40bd58280ef95c4b","observation_id":"9dcec2f4-ee2f-438d-8a71-8b2b4c50cf3f","resolution":{"observed_at":"2026-08-02T21:28:27.738468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.890674Z","title":"A unified framework for establishing the universal approximation of transformer-type architectures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.890674Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6b4fbbb0f9c6534632f4ea5ae17b5b2999f4ee380b6b3bc5e072f5065c60008d","observation_id":"3a154508-52de-4dab-b3d7-8c63331d65bd","resolution":{"observed_at":"2026-08-02T21:28:27.890674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15014","last_updated":"2026-05-19T14:33:39Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T14:13:38Z","title":"Efficient and Minimax Optimal In-context Nonparametric Regression with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15014","snapshot_observed_at":"2026-08-02T21:28:28.002565Z","title":"Efficient and minimax-optimal in-context nonparametric regression with transformers.arXiv preprint arXiv:2601.15014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.002565Z"},"links":{"cited_paper":"/paper/2601.15014","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:e2d90bf357ffb24d3e59290a643d90050ed59d374fdc048c4d5fa4f84eee5568","observation_id":"0631de7d-335e-43e3-b836-7243964006c8","resolution":{"observed_at":"2026-08-02T21:28:28.002565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.198176Z","title":"Bert: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.198176Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:d959490e02f5f14c18d3c201606f2132af89a87531345efa2e23629f35ca7637","observation_id":"3015893b-4405-4162-b14b-292db3e5d535","resolution":{"observed_at":"2026-08-02T21:28:28.198176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.302711Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.302711Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:e6b4971f3e9c057f3f2db1c65bb228e85fc4dc5067d03e4cb12719ee7b3da32f","observation_id":"74b568fe-6acc-4a49-a4bd-22c86ff064c3","resolution":{"observed_at":"2026-08-02T21:28:28.302711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.421735Z","title":"Inductive biases and variable creation in self-attention mechanisms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.421735Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:8cb13158d10001762da4c40ad71ba4d19a82fec651c74f41d29115915e6d5bbf","observation_id":"8460b952-662f-4668-992d-b767a01fc7ef","resolution":{"observed_at":"2026-08-02T21:28:28.421735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.506109Z","title":"How do noise tails impact on deep relu networks?The Annals of Statistics, 52(4):1845–1871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.506109Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7c03f35a611b6e94bb34eafaf15fc2c0bec9010b554d4048648e90837a5679f4","observation_id":"c42b2c03-6729-453e-b86e-560979d2eaeb","resolution":{"observed_at":"2026-08-02T21:28:28.506109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.660201Z","title":"Deep neural networks for esti- mation and inference.Econometrica, 89(1):181–213, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.660201Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f6cd5ff805cf435010c5bfff5d26d3d9ea010ae560984d3636e88c29cc34ecc8","observation_id":"21fca2ad-42cd-474f-8f6e-442a5c6a24a2","resolution":{"observed_at":"2026-08-02T21:28:28.660201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.761626Z","title":"Cambridge university press, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.761626Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:eba9fa74a4220f53d45a3a2f712444e1301c1efc3c9df854c0826a90070385b9","observation_id":"52cf793c-4063-4ea4-a189-cc84f8b183f8","resolution":{"observed_at":"2026-08-02T21:28:28.761626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.870976Z","title":"Approximation rates for neural networks with encodable weights in smoothness spaces.Neural Networks, 134:107–130, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.870976Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:14fd3bd0054ab729a2d3c50f7a080fdff3c957d695e75d9a9f07651307dfe07a","observation_id":"50bfc956-8029-4e2f-9fa0-23f6530e8275","resolution":{"observed_at":"2026-08-02T21:28:28.870976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.932299Z","title":"On the rate of convergence of a classifier based on a transformer encoder.IEEE Transactions on Information Theory, 68(12):8139–8155, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.932299Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f7aad19af16867d50a68101e40a6e0605e822764979d71e64047056d97e02521","observation_id":"bcfbd33e-b72c-4476-9626-f494cb8692e3","resolution":{"observed_at":"2026-08-02T21:28:28.932299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.050031Z","title":"Understanding scaling laws with statisti- cal and approximation theory for transformer neural networks on intrinsically low- dimensional data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.050031Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:8cc3b8557a9c463e5d36910eca17eba71455fce757f9dc40ecd51af686046607","observation_id":"29a4e6c4-1d11-4e20-8767-9cf148ade33f","resolution":{"observed_at":"2026-08-02T21:28:29.050031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.159551Z","title":"Minimal width for universal property of deep rnn.Journal of Machine Learning Research, 24(121):1–41, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.159551Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:e3201c70685581febeb59bbbcc36d171c97b91e2e6033c97ef453d705a9ac7f2","observation_id":"84ba33a6-a5b1-478a-a558-35c34085ea7d","resolution":{"observed_at":"2026-08-02T21:28:29.159551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.291247Z","title":"Universal approximation with softmax attention.arXiv preprint arXiv:2504.15956, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.291247Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:19cf3c46e6e626784a61c425399679d7ba4dbc4117caf2c1ce4bbf464f1fe505","observation_id":"59978333-edd3-4ecd-a1e5-d7b4ee9e32ca","resolution":{"observed_at":"2026-08-02T21:28:29.291247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.408007Z","title":"Approximation rate of the transformer architecture for sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.408007Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:a0a6f17284dc0bb4415fb4a6736c828e7fa178f63d78c2f598988a5db1bfb12f","observation_id":"a1ac003f-e4f8-457f-a66e-5c90c914d2ce","resolution":{"observed_at":"2026-08-02T21:28:29.408007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-07T16:01:45.120039Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-02T21:28:29.502605Z","title":"Approxima- tion bounds for transformer networks with application to regression.arXiv preprint arXiv:2504.12175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.502605Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:72bda9853b862f940a2d40101ac5a3a3416203ebbac466fe8539dea1c8f911c4","observation_id":"4ae2c7f0-c677-4dca-b5c1-d7f38b197cb3","resolution":{"observed_at":"2026-08-02T21:28:29.502605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13558","last_updated":"2025-04-18T08:56:53Z","snapshot_observed_at":"2026-08-07T16:01:12.010315Z","submitted_at":"2025-04-18T08:56:53Z","title":"Transformers Can Overcome the Curse of Dimensionality: A Theoretical Study from an Approximation Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13558","snapshot_observed_at":"2026-08-02T21:28:29.665918Z","title":"Transformers can overcome the curse of dimensionality: A theoretical study from an approximation perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.665918Z"},"links":{"cited_paper":"/paper/2504.13558","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:18b7fac094c219878351267c03cbb61044a5b4594e35ce162e3d604a197014f2","observation_id":"53c04e93-8632-4176-9f9f-cd0403ff7dca","resolution":{"observed_at":"2026-08-02T21:28:29.665918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.779421Z","title":"Deep nonparametric regression on approximate manifolds: Nonasymptotic error bounds with polynomial prefactors.The Annals of Statistics, 51(2):691–716, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.779421Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:156c83b5fa67c64c12de4a968bf7c7e04b0a0504e98c5e72aeeae3bf25056e44","observation_id":"edb1e354-523b-40eb-93c1-43e29e926da5","resolution":{"observed_at":"2026-08-02T21:28:29.779421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.879046Z","title":"Approximation bounds for recurrent neural networks with application to regression.arXiv preprint arXiv:2409.05577, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.879046Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:9f0cdeaf42364d1be3be57fe51de04a91dff00d1caef8c86cd94cabb8d03b790","observation_id":"4a49078c-b132-492e-a8b4-c2e8951e1e92","resolution":{"observed_at":"2026-08-02T21:28:29.879046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.030422Z","title":"Are transformers with one layer self-attention using low-rank weight matrices universal approximators? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.030422Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:eab6772518c51c75a5b3f9b493548b2fa64872203c4e0dca5ff53ff24415b738","observation_id":"03d88569-eff9-45f2-9fd9-c2b44b11131b","resolution":{"observed_at":"2026-08-02T21:28:30.030422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.176620Z","title":"On the optimal memorization capacity of trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.176620Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6db4025306caadddce0cb07a395e32d3e52cd8dc8c22b286ceabc9503ef938b1","observation_id":"5781e412-70e1-47c4-9cbf-75993ee51e79","resolution":{"observed_at":"2026-08-02T21:28:30.176620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.303270Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.303270Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:098ad6f85b13388946f30a3f5f78cb69556499c36d9efd623ffb1d96bde5d52c","observation_id":"b82921ca-47a1-4901-b929-5422a6d5df4a","resolution":{"observed_at":"2026-08-02T21:28:30.303270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.429646Z","title":"Provable memorization capac- ity of transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.429646Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:17905334cb0337c751972f21370c9b5ab1e2aca2e76785d74d99f31637ca1a3e","observation_id":"650bce6b-9287-4c58-9aca-20b450104f33","resolution":{"observed_at":"2026-08-02T21:28:30.429646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.607066Z","title":"Transformers are minimax optimal non- parametric in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.607066Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:028e4717815a879ea6bd4eb085a662d29d3d81c0bfb1993c05200168abe76876","observation_id":"3e335400-d249-410d-a1f5-27555456dd6b","resolution":{"observed_at":"2026-08-02T21:28:30.607066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.744229Z","title":"On the rate of convergence of fully connected deep neural network regression estimates.The Annals of Statistics, 49(4):2231–2249, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.744229Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c03f64e896bc9ede0c9e5a39a93a4778ad71f9835bb8f21f7f0b899fef74bdad","observation_id":"4f45b3b4-d6e9-4c0e-8bb9-0d60c0de16be","resolution":{"observed_at":"2026-08-02T21:28:30.744229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.872899Z","title":"Univer- sal approximation under constraints is possible with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.872899Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:567834f57e61af8253f8d5c9b29d5204208bff4d30b49faf4b23de687f9ae91f","observation_id":"b668f606-30f5-4b2e-ae07-52c39ce70c3f","resolution":{"observed_at":"2026-08-02T21:28:30.872899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.044785Z","title":"Approximation and optimization theory for linear continuous-time recurrent neural networks.Journal of Machine Learning Research, 23(42):1–85, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.044785Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:82800752b85022b3a195c44af79e5b9f07d8c9d4d143422375f5b9b074892cf4","observation_id":"260ffc38-d2a9-45d3-ae22-ae304c2de87f","resolution":{"observed_at":"2026-08-02T21:28:31.044785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.160241Z","title":"Generalization analysis of transformers in distribu- tion regression.Neural Computation, 37(2):260–293, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.160241Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7a0e0fea2590a2db8c4ea3a5dc4d8531084fc91d2d6cd2704e7dd3d0ad365f33","observation_id":"bda47ccb-5703-41b4-b655-844792366c2d","resolution":{"observed_at":"2026-08-02T21:28:31.160241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.326706Z","title":"Deep network approxi- mation for smooth functions.SIAM Journal on Mathematical Analysis, 53(5):5465– 5506, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.326706Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7995b7ddf1c55cabd24274f325743c9e4a8bc26fb650b4d2e88260fe9e8d505d","observation_id":"108ea5fe-2b55-4c77-9472-2eaa21ea1ebd","resolution":{"observed_at":"2026-08-02T21:28:31.326706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.429497Z","title":"Upper and lower memory capacity bounds of transformers for next- token prediction.arXiv preprint arXiv:2405.13718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.429497Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7f5fdd46ca3fbc7038fbffce3cc76fefc54d4cea41e1727bbdb9482238bfb428","observation_id":"5839742c-0e87-4728-bc4d-4e84d1d4e510","resolution":{"observed_at":"2026-08-02T21:28:31.429497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.589919Z","title":"Memorization capacity of multi-head attention in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.589919Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:2507a1f221d418428227b39a8447611a2b648370fc29e1ceede7ed6af96d8f3e","observation_id":"251460d0-5f51-4561-9b09-e150acfe6811","resolution":{"observed_at":"2026-08-02T21:28:31.589919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.739676Z","title":"Rates of approximation by relu shallow neural networks.Journal of Complexity, 79:101784, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.739676Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f9fafdd1795aa3b298c53ac322c55fc15540c6ea96c98b69325dfdbbfec6f7fb","observation_id":"5c1cf47c-8ded-4184-bbb6-c2965444c604","resolution":{"observed_at":"2026-08-02T21:28:31.739676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.921512Z","title":"Adaptive approximation and generalization of deep neural network with intrinsic dimensionality.Journal of Machine Learning Research, 21(174):1–38, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.921512Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c33a4a0933e39edaf64a541ecb9bf51c19c459aac14071c8a6d0e2af6f21c54e","observation_id":"cf525ea2-cadb-48a4-95e8-8298ca2ab187","resolution":{"observed_at":"2026-08-02T21:28:31.921512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.126644Z","title":"Provable memorization via deep neural networks using sub-linear parameters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.126644Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:a89bf5393ea85118d980aac27f6f3dea2f1dee068e641d600af47de5340f39d4","observation_id":"43b61371-d162-4bca-97b7-97550f2f9e86","resolution":{"observed_at":"2026-08-02T21:28:32.126644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.361578Z","title":"Equivalence of approximation by convolu- tional neural networks and fully-connected networks.Proceedings of the American Mathematical Society, 148(4):1567–1581, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.361578Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ba1eb1e39311192ee2ec79377c53df43470a3370744f639117dce49442f9c359","observation_id":"742af754-03ef-4462-9503-40a2cfa02e69","resolution":{"observed_at":"2026-08-02T21:28:32.361578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.551226Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.551226Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c6c1cc0cb4d7c8e73a830a6ee6353e639e884764538466c3fc120cdafdb1e4d2","observation_id":"d868eeef-7558-442d-b0dc-6b00fee595bd","resolution":{"observed_at":"2026-08-02T21:28:32.551226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.650600Z","title":"Nonparametric regression using deep neural net- works with relu activation function.Annals of statistics, 48(4):1875–1897, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.650600Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:5b85e2da9fcd5bc2ffc76d0af24c0ab3d9796c0751c3be451fcb0292fa45642e","observation_id":"7eb5b0ad-7a9a-465e-a2b1-a5decf1adfa0","resolution":{"observed_at":"2026-08-02T21:28:32.650600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.770414Z","title":"The kolmogorov–arnold representation theorem revisited","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.770414Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:50a51dfb22cfee3615fc577f7d543fcab44e9debca0cbf0514fc95ed7acd6699","observation_id":"dacd7337-14ac-4d67-9a69-ff3c8d659772","resolution":{"observed_at":"2026-08-02T21:28:32.770414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.935975Z","title":"Understanding in- context learning on structured manifolds: Bridging attention to kernel methods","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.935975Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:8f4aa9c35fd56e796865cfadac60006e07a2aa894be2f2b5827c0bab7795f4f8","observation_id":"de14478b-5b9a-48a7-8353-971145ea79f6","resolution":{"observed_at":"2026-08-02T21:28:32.935975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.054527Z","title":"Deep network approximation char- acterized by number of neurons.Communications in Computational Physics, 28(5), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.054527Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:4faff358c60e4a8212b5865c22627dfa597a1b90ac4465212ef90db94f646ad9","observation_id":"1bf983f1-d5f5-433a-a9ec-1c0b5da649fa","resolution":{"observed_at":"2026-08-02T21:28:33.054527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.200221Z","title":"Optimal approximation rate of relu networks in terms of width and depth.Journal de Math´ ematiques Pures et Appliqu´ ees, 157:101–135, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.200221Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:4e0e8f866f9914972ccb0c8c90717f455ab88ab80a9a51c1ef6268b53cb56222","observation_id":"d17c58a7-8caf-4b31-9793-6dd6a74c6613","resolution":{"observed_at":"2026-08-02T21:28:33.200221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.378677Z","title":"Optimal approximation rates for deep relu neural networks on sobolev and besov spaces.Journal of Machine Learning Research, 24(357):1–52, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.378677Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:cba6412102646ed86a0da438f25d39bcea3c131edb93dfc4c679ca6cd637761f","observation_id":"e4e39434-fbd4-46d0-a726-e7376d1f7765","resolution":{"observed_at":"2026-08-02T21:28:33.378677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.503352Z","title":"Optimal rates of convergence for nonparametric estimators.The annals of Statistics, pages 1348–1360, 1980","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.503352Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:98465daac693b449cb3a7a37604cda5a1375c1dae392e96211e04d2aaca52b0f","observation_id":"73080394-9a7f-4dec-bd37-0cb148359b01","resolution":{"observed_at":"2026-08-02T21:28:33.503352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.641883Z","title":"Adaptivity of deep reLU network for learning in besov and mixed smooth besov spaces: optimal rate and curse of dimensionality","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.641883Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:5f32d42c588b84a70da884a02ac5120bceb23c978c54e713b9ac7fd5a771d79c","observation_id":"0dcf055d-49fd-40e5-87b4-b8361a039fd6","resolution":{"observed_at":"2026-08-02T21:28:33.641883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.794727Z","title":"Approximation and estimation ability of trans- formers for sequence-to-sequence functions with infinite dimensional input","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.794727Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:14083de114a87478ca1af609a411d2c88f995f9a26bfca97ef231a78e835c415","observation_id":"d7ad0ad1-320c-4f5a-96d9-0591b72e1610","resolution":{"observed_at":"2026-08-02T21:28:33.794727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11467","last_updated":"2025-02-17T05:56:11Z","snapshot_observed_at":"2026-08-14T02:16:57.419217Z","submitted_at":"2025-02-17T05:56:11Z","title":"Approximation of Permutation Invariant Polynomials by Transformers: Efficient Construction in Column-Size","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11467","snapshot_observed_at":"2026-08-02T21:28:33.955158Z","title":"Approximation of permutation invariant polynomials by transformers: Efficient construction in column-size.arXiv preprint arXiv:2502.11467, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.955158Z"},"links":{"cited_paper":"/paper/2502.11467","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:367a3319e09b2991d01c2a29deece3ea1d708a222b30e6c60b228a4171c74f45","observation_id":"ec702a1a-f943-401f-8d3b-7efa7b87a55f","resolution":{"observed_at":"2026-08-02T21:28:33.955158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.094329Z","title":"Weak convergence","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.094329Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:66ed35a071924eacac962a8906d69bad5c1db0332df4ffa18252cf4dc4572189","observation_id":"83aa814b-aab6-44a8-9754-a959086b241a","resolution":{"observed_at":"2026-08-02T21:28:34.094329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.244520Z","title":"On the optimal memorization power of reLU neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.244520Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:1ba545a476461217af1f0c61df121c157f200a63d77583e8d8ba36f3cd8b9f5d","observation_id":"99685651-1abc-433d-86a7-2760e342b9b3","resolution":{"observed_at":"2026-08-02T21:28:34.244520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.372655Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.372655Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7ffdecd249f0565056b4870b5d036fdfb0ef7a320304faa5a3a01cc52b948e3e","observation_id":"89b4f471-10f4-4ce3-9e09-92b1fd3deeec","resolution":{"observed_at":"2026-08-02T21:28:34.372655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.546484Z","title":"Prompt tuning transformers for data memorization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.546484Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:2105318efe599eb59c6ef8ab8cd617175bc8dafb67de7268406a6cce2e955c21","observation_id":"56d032e3-a846-4c70-a37c-2f027e3cdcb7","resolution":{"observed_at":"2026-08-02T21:28:34.546484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.685239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.685239Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:865029d8e35dc562522d961714426b96499ae257dae4c2bd7108660f5428d746","observation_id":"c22ce1a9-de37-476e-9d5d-3a8213da738f","resolution":{"observed_at":"2026-08-02T21:28:34.685239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.856079Z","title":"Statistically meaningful approximation: a case study on approximating turing machines with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.856079Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:24e13b1ca204be967b976890b8ee80747f33f090cb6dc5885440f033f95e818b","observation_id":"f2100755-2050-4fab-b5ba-e3c77e50f39b","resolution":{"observed_at":"2026-08-02T21:28:34.856079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00901","last_updated":"2025-07-18T13:39:44Z","snapshot_observed_at":"2026-08-15T15:10:37.011963Z","submitted_at":"2024-09-02T02:26:01Z","title":"On the optimal approximation of Sobolev and Besov functions using deep ReLU neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00901","snapshot_observed_at":"2026-08-02T21:28:34.968470Z","title":"On the optimal approximation of sobolev and besov functions using deep relu neural networks.arXiv preprint arXiv:2409.00901, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.968470Z"},"links":{"cited_paper":"/paper/2409.00901","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:560a46a5dfa6c2696e48e8004366a2c243bded301286c45167af94c832be177e","observation_id":"986e253b-7c69-4463-8e21-357e00d1a999","resolution":{"observed_at":"2026-08-02T21:28:34.968470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.048382Z","title":"Nonparametric regression using over- parameterized shallow relu neural networks.Journal of Machine Learning Research, 25(165):1–35, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.048382Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:9e65fbfb99b4d69cd6b00855dce6b6686988c8d15b1f1b5eca900d3352546804","observation_id":"14739f9b-4530-47ab-b1cb-451be7a90070","resolution":{"observed_at":"2026-08-02T21:28:35.048382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.137363Z","title":"Error bounds for approximations with deep relu networks.Neural networks, 94:103–114, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.137363Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:3d65065c2af29248cf5b12113afb1920fd763fdafe806fc556d11b6bf8105db4","observation_id":"f319b704-d617-4bd8-85bb-28ec3cf8b13d","resolution":{"observed_at":"2026-08-02T21:28:35.137363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.306182Z","title":"Optimal approximation of continuous functions by very deep relu networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.306182Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:0d7588d66728fafc8622c4c177cf47cb24346354ceb1ca51c2f7f4e578d6a390","observation_id":"f64b5c00-4260-436c-9af7-3131b2b60151","resolution":{"observed_at":"2026-08-02T21:28:35.306182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.487880Z","title":"Are transformers universal approximators of sequence-to-sequence func- tions? InInternational Conference on Learning Representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.487880Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:fcb4a554c0a2ea7974e63da8736967c984425f5457a0c2114c41015d0553b236","observation_id":"e94b9401-45af-4c6b-8d36-f462d85f6de9","resolution":{"observed_at":"2026-08-02T21:28:35.487880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.601184Z","title":"O (n) connections are expressive enough: Universal approximability of sparse transformers.Advances in Neural Information Processing Systems, 33:13783–13794, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.601184Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:0ab3a7b814a3492223a46657e29fbde68ec3d93d08135192b00fabce9f512d73","observation_id":"ce2b942a-2dfd-40b5-8197-b5f2af50374d","resolution":{"observed_at":"2026-08-02T21:28:35.601184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.721401Z","title":"Theory of deep convolutional neural networks: Downsampling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.721401Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:5555b7b20bcce3ef42ee0469a4ee24cd5d75da2335c736c9ff047609ba180f0e","observation_id":"4ac02717-490a-42a6-bc5b-d1643ab170dc","resolution":{"observed_at":"2026-08-02T21:28:35.721401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.859983Z","title":"Universality of deep convolutional neural networks.Applied and computational harmonic analysis, 48(2):787–794, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.859983Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ba6d7901262cd5bd3f9045eb83ebd4939e76cc7a384fab586c3c704791ddc29e","observation_id":"89d356a7-abf0-415b-bbb9-5f6fefffdbca","resolution":{"observed_at":"2026-08-02T21:28:35.859983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-05T23:11:14.232947Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2602.20555."}