{"as_of":"2026-08-21T13:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf3fec01bd58d3cd82f9fb59aacf314f9c6d5489db6c57e524f4733a26b3ddac","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:42:56.159870Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:28:29.502605Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-02T21:28:29.502605Z","title":"Approxima- tion bounds for transformer networks with application to regression.arXiv preprint arXiv:2504.12175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.502605Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c35c710d6811e208b9ac19b365df7c19138aa8d04f65ea4c07dd4583541978d9","observation_id":"4ae2c7f0-c677-4dca-b5c1-d7f38b197cb3","resolution":{"observed_at":"2026-08-02T21:28:29.502605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":"2504.12175","doi":"10.48550/arxiv.2504.12175","metadata_source":"pith","pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Approximation bounds for transformer networks with application to regression","venue":"stat.ML","work_id":"56341c16-0259-451f-823f-270622651b33","year":2025},"citing_paper":{"arxiv_id":"2605.07463","last_updated":"2026-06-22T07:13:57Z","snapshot_observed_at":"2026-08-14T01:31:49.907471Z","submitted_at":"2026-05-08T09:10:31Z","title":"Approximation Error Upper and Lower Bounds for H\\\"{o}lder Class with Transformers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:48.315911Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2605.07463"},"observation_digest":"sha256:32a501797f50b0e42397a0bfebbbd923c475b13cdce43f95faf190aaaf11be13","observation_id":"8947f980-88e6-4377-a0f9-140866b93090","resolution":{"observed_at":"2026-05-11T04:00:54.962487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":"2504.12175","doi":"10.48550/arxiv.2504.12175","metadata_source":"pith","pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Approximation bounds for transformer networks with application to regression","venue":"stat.ML","work_id":"56341c16-0259-451f-823f-270622651b33","year":2025},"citing_paper":{"arxiv_id":"2605.07463","last_updated":"2026-06-22T07:13:57Z","snapshot_observed_at":"2026-08-14T01:31:49.907471Z","submitted_at":"2026-05-08T09:10:31Z","title":"Approximation Error Upper and Lower Bounds for H\\\"{o}lder Class with Transformers","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-30T23:20:27.144438Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2605.07463"},"observation_digest":"sha256:88fc10b67f11bfb79d7994b163042aabe3e792b29c35784c100eddfecd6bf41f","observation_id":"8f90cc76-a1ca-4aa6-b5d4-3aedcf4aa6cb","resolution":{"observed_at":"2026-07-01T13:25:45.028432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":"2504.12175","doi":"10.48550/arxiv.2504.12175","metadata_source":"pith","pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Approximation bounds for transformer networks with application to regression","venue":"stat.ML","work_id":"56341c16-0259-451f-823f-270622651b33","year":2025},"citing_paper":{"arxiv_id":"2607.06781","last_updated":"2026-07-07T20:21:57Z","snapshot_observed_at":"2026-08-13T04:09:16.454564Z","submitted_at":"2026-07-07T20:21:57Z","title":"On Explicit Super-Expressive Approximation for Neural Networks","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-07-10T21:27:16.595303Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2607.06781"},"observation_digest":"sha256:806339c757deb93bc8d8adbf97801b1855c096c52e0139bb4962529f0ee94313","observation_id":"b35c16cf-bbcd-4538-a77d-cfa4a2a02ccf","resolution":{"observed_at":"2026-07-10T21:27:34.873323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12175/citation-record","integrity":"/paper/2504.12175/integrity","json":"/paper/2504.12175/citation-record.json","paper":"/paper/2504.12175"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.161140Z","title":"The generalization abili ty of online algorithms for dependent data","venue":null,"work_id":"a2496951-d161-4c73-9fbd-1a88fcab9166","year":2012},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.873554Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:3ea097d607f648c8721d102409493dfe1ec39d8b33cedf6c5fcd4a23bcff4915","observation_id":"913676c4-d348-4582-bb43-d5542f5b85a7","resolution":{"observed_at":"2026-08-16T12:42:57.165962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.147557Z","title":"Bartlett","venue":null,"work_id":"1cc77e95-b3db-4b2d-b84e-efcef0ec1645","year":1999},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.879106Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:f226b95736e99171551e7ca5210a55190509614840cf644b95cb9da9521c7277","observation_id":"c8b5b3c2-91dd-456b-940a-9e622c873fbd","resolution":{"observed_at":"2026-08-16T12:42:57.151441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.131591Z","title":"Nearly-tight vc- dimension and pseudodimension bounds for piecewise linear neural networks","venue":null,"work_id":"657e6f0f-8461-41b7-891b-6d8db503b81c","year":2019},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.883999Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:23fb7b46f91770534ec4f1315b3f4e5f3bb32440329d613cb117e909a5204da4","observation_id":"ac03824e-ffd4-4ef7-acfb-535627f93526","resolution":{"observed_at":"2026-08-16T12:42:57.137197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.115170Z","title":"Vapnik-chervonenki s dimension of neural nets","venue":null,"work_id":"9a429f77-8b93-4dc0-9d2a-972b5470e8a5","year":2003},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.888950Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:26f3b81389731dd284b5b4dca1acd43d498cb7385d2e09ae1248de367d2a9f2a","observation_id":"e30eb633-836b-4d5d-9775-f962feed4501","resolution":{"observed_at":"2026-08-16T12:42:57.120098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.098974Z","title":"Birth of a transformer: A memory viewpoint","venue":null,"work_id":"b6b6ae4e-7cd9-4cca-b946-1cb4399dfa3f","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.893081Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:4db1e4410786df9570996bf1eb53a7a664645c00a8a1884bbf5bbec10d097543","observation_id":"d77a20f0-9434-45a1-93d2-0498f8e682ca","resolution":{"observed_at":"2026-08-16T12:42:57.104782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.084484Z","title":"Nonparametric regression on low-dimensional manifolds using deep relu networks: Funct ion approximation and statistical recovery","venue":null,"work_id":"0479b1e9-2c0a-4a84-a5b1-48870a935807","year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.897062Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:784cf4e88f43ca059f37bcc76290664b8d686ae7e4d25913f6d0a7a030538889","observation_id":"2a38be25-242d-44f0-b97a-ac372ee4f8a1","resolution":{"observed_at":"2026-08-16T12:42:57.088530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.070963Z","title":"Overcoming a theoretical limitation of self-attention","venue":null,"work_id":"e677ed69-3489-4c79-9541-7d7b17ec36e5","year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.901231Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:7009dc0dd4e9372b10b6d48cfadb6add58b84a4029bef2a5d1026e52bb961634","observation_id":"4a5ed018-6803-49e4-af72-e13e6fe88b70","resolution":{"observed_at":"2026-08-16T12:42:57.075066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.057356Z","title":"Approximation by superpositions of a si gmoidal function","venue":null,"work_id":"d99bfc54-bcd5-4102-a7ca-3d5f4d623557","year":1989},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.905043Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:c72c0f87abda9b02bb61b8d4269e2df7501ce260899fd263eb0365d123d42f55","observation_id":"d507b979-58e6-433b-a570-4267652d1862","resolution":{"observed_at":"2026-08-16T12:42:57.062034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.043197Z","title":"The bramble–hilbert lemma for convex domains","venue":null,"work_id":"20f26e8e-4e0d-4e9b-bb8d-d73a2fba44fc","year":2004},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.909188Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:b8d37ae7f81cc144f2f596cf3c9cdc33c4e71149e5e39380a887375eddf6884c","observation_id":"7499284e-2f58-440e-b128-5372eb2562d4","resolution":{"observed_at":"2026-08-16T12:42:57.048460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.025839Z","title":"BERT: Pre-training of deep bidirectional transformers for language understan ding","venue":null,"work_id":"42ae9b6a-f92f-4941-b34e-ff21308f71ec","year":2019},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.913842Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:74c7fb256a0f878aebacff46c87ad96acf042eeffee03e72f4e88b48b7d29c6c","observation_id":"bef35695-6350-4709-a6f5-e1fa42b83d96","resolution":{"observed_at":"2026-08-16T12:42:57.030282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:55.918067Z","title":"Nonlinear approximation","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.918067Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:e8f24ce4082632edc3c5538fc97b923524b1f8cde6292aefce2570b975200acc","observation_id":"e307a2cb-45af-416d-acc8-3a1b050b531a","resolution":{"observed_at":"2026-08-16T12:42:55.918067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:57.003464Z","title":"Constructive Approximation, volume 303","venue":null,"work_id":"8f69b789-aeab-4959-a9e6-bbfd3c4f4e4f","year":1993},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.922230Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:74b644a143f9f8c79a6735137c9394543ab7f9417d6f75b5bd735e3f08eefc75","observation_id":"79bbfebb-4a03-46f8-a0b6-a9acabc6d675","resolution":{"observed_at":"2026-08-16T12:42:57.007679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.990388Z","title":"Semi-supervised deep sobolev regression: Estimation and variable selection by r equ neural network","venue":null,"work_id":"e46ff85a-e81a-4a7f-b4da-89e9f27a0531","year":2025},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.926047Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:4cd2664ffc360a74eca368d61410445c060c2afec7a8730fd38beb5cb4758fa2","observation_id":"db815f1f-8a08-4f20-a7c7-47b8c606a242","resolution":{"observed_at":"2026-08-16T12:42:56.995358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.977362Z","title":"Minimax estimation via wavelet shrinkage","venue":null,"work_id":"ee1003f7-0b1b-4baf-a772-5fbb7331c573","year":1998},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.930180Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:946b658b5b4888c16ff8d86dc2a2eba16825ab98f0870c74453f1b0bb6e0d8c6","observation_id":"1c9821e2-0ed1-4d7c-b67a-4370a9a82711","resolution":{"observed_at":"2026-08-16T12:42:56.982039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.961791Z","title":"An image is worth 16x16 wo rds: Transformers for image recognition at scale","venue":null,"work_id":"e4c82d3f-061c-4e8a-a54a-9cc460b70588","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.933868Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:75db2221dfc3aae1ed7ed63ac4252bff4577eb012da336271d00937cb76707d9","observation_id":"1b69fcd0-44b4-4ce0-a37f-dc7bfed90814","resolution":{"observed_at":"2026-08-16T12:42:56.965617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.949931Z","title":"Inductive biases and variable creation in self-attention mechanisms","venue":null,"work_id":"38ce1709-521c-4c68-a59c-6c8a9059d067","year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.937853Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:6ead86b3360c8d3b9b6b9996d634b4488b4b743b176a51e64d14fdd1be2c0fcc","observation_id":"5be59e69-8622-4e9b-aad4-73a359c8f66b","resolution":{"observed_at":"2026-08-16T12:42:56.954102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:55.941743Z","title":"Partial Diﬀerential Equations , volume 19","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.941743Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:7733f19ab1f64f7d2bf2c55eb4048f4465d893da8aae4bcfd816b439f9454002","observation_id":"ce440c56-272a-4352-a31e-12acfc1f3907","resolution":{"observed_at":"2026-08-16T12:42:55.941743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12166","last_updated":"2022-02-24T16:06:01Z","snapshot_observed_at":"2026-08-20T04:56:01.932347Z","submitted_at":"2022-02-24T16:06:01Z","title":"Attention Enables Zero Approximation Error","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12166","snapshot_observed_at":"2026-08-16T12:42:55.945307Z","title":"Attention enables zero approximation error","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.945307Z"},"links":{"cited_paper":"/paper/2202.12166","citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:f4972840dfacf626de5d39d5b762055b32f7891a9c2b2a7ecefebf0b945e3733","observation_id":"13518983-ef54-49f9-936a-9c9fe5196cb4","resolution":{"observed_at":"2026-08-16T12:42:55.945307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.929413Z","title":"Deep ne ural networks for estimation and inference","venue":null,"work_id":"34939326-1fc2-4844-9c19-1d5a64eddaad","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.949120Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:b2de6f32e2971dac15b282c15646d06f993c41eea9acd1d1233c11b1560f0454","observation_id":"1df9f4ed-34b5-439a-b2e9-99fbb544a26d","resolution":{"observed_at":"2026-08-16T12:42:56.933875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.915652Z","title":"Over-parameterized deep nonparametric regression for dependent data with its a pplications to reinforcement learning","venue":null,"work_id":"e6273b3a-346c-4d44-89d3-ca94b86e1a15","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.952883Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:6a20f274c99cd008f82ef50bdcf04fecad71faf64c2a2f90b0feaee01b2c3513","observation_id":"48661711-e191-4950-9d16-cfe3066ad3ea","resolution":{"observed_at":"2026-08-16T12:42:56.920421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.903376Z","title":"On the rate of convergence of a classiﬁer based on a transformer encoder","venue":null,"work_id":"7dff2449-3ced-4003-94bf-d5ac97570d12","year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.956810Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:6ec9019f900db69b7243e19b2966431f82295393cd7c1a2630f04d45fad8f325","observation_id":"21d27184-ed28-4dc0-b543-5d14fe6d0718","resolution":{"observed_at":"2026-08-16T12:42:56.907581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.889136Z","title":"Understanding sc aling laws with statistical and approximation theory for transformer neural networks on in trinsically low-dimensional data","venue":null,"work_id":"7f3149c3-21cb-4678-bb57-b2324661bdfe","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.960430Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:ecf713d74f5c17936d77ef09f66ba46f0cba93f66dd0503bd9938e203f03228f","observation_id":"3e02c866-6479-4483-80cf-aa44e7988a8d","resolution":{"observed_at":"2026-08-16T12:42:56.894078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.876012Z","title":"D eep residual learning for image recognition","venue":null,"work_id":"e1afb14d-09a0-41e8-9b3b-71a03bf3b8a9","year":2016},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.964554Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:fab8e785eee1687a06be894f3787777028e3c850e8f861a91d688973807b614a","observation_id":"ab24eef8-76f4-4b51-9326-9fadbb7c4a13","resolution":{"observed_at":"2026-08-16T12:42:56.880519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.861887Z","title":"Minimal width for universal property of deep rnn","venue":null,"work_id":"c1444952-6228-4385-8104-cad8a36e6115","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.968222Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:15caa716ce4da4bb43f6e44b632a9b803128f308e7ab9251480db988297ba548","observation_id":"04667670-ca24-4f4a-bd50-cee985ccc718","resolution":{"observed_at":"2026-08-16T12:42:56.867489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:55.971771Z","title":"M ultilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.971771Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:a2c49998547e0c1680082551b2eeeb710fc773a1daa12af01e7e4f4c01b0e4d3","observation_id":"93920c8b-3d56-489f-8163-163bcffd5b4a","resolution":{"observed_at":"2026-08-16T12:42:55.971771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.840221Z","title":"Mixing time estimation in re- versible markov chains from a single sample path","venue":null,"work_id":"ae73ea74-e76d-488a-89af-24aafcc5501c","year":2015},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.975290Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:b86d02d927fb0c2778192f3873b017967ffd814e9fc38ef8aa4b759041574bdf","observation_id":"1978759c-b54a-4e38-8868-5d2d98e63319","resolution":{"observed_at":"2026-08-16T12:42:56.844893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.828079Z","title":"Fundamental limits of prompt tuning transformers: Univers ality, capacity and eﬃciency","venue":null,"work_id":"5909a9d9-ae46-4386-8f85-6869a6a499e2","year":2025},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.978952Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:e8a900a838f2cf382bb51eee351e873506210e1baa7a73bddc6fca69d6ff61c4","observation_id":"4c606d93-dc0c-4dc6-a697-bcaafc06d9a2","resolution":{"observed_at":"2026-08-16T12:42:56.832883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.816338Z","title":"Approximation rate of th e transformer architecture for sequence modeling","venue":null,"work_id":"988ac646-361f-4873-a548-6219f3ba37ee","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.982461Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:569f38962c8f516c123455aca3a33207973510a3ba00a9968cdaa43bbf0d77a0","observation_id":"9e05d9f1-d75e-40d3-8de6-9a0426b5060d","resolution":{"observed_at":"2026-08-16T12:42:56.820444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.804265Z","title":"Deep approximate policy iteration","venue":null,"work_id":"a3b12c91-b58b-42de-aef7-8d6bd8079599","year":2025},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.985866Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:2f3ab1c47e5d4e8206313891a420c65671d83817284c50b167858625dafe6094","observation_id":"88f02ef2-9f76-4ef5-ae5b-d1b4185f47ae","resolution":{"observed_at":"2026-08-16T12:42:56.808582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02538","last_updated":"2024-04-28T10:10:33Z","snapshot_observed_at":"2026-08-20T11:01:56.703854Z","submitted_at":"2024-04-03T07:50:53Z","title":"Convergence Analysis of Flow Matching in Latent Space with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02538","snapshot_observed_at":"2026-08-16T12:42:55.989833Z","title":"Conve rgence analysis of ﬂow match- ing in latent space with transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.989833Z"},"links":{"cited_paper":"/paper/2404.02538","citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:3b408122462015443d4195e6f7689af88c822c61080560983c443316c68fdcdf","observation_id":"ab415b98-5859-4e8c-81bb-7fe07fd25326","resolution":{"observed_at":"2026-08-16T12:42:55.989833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.791986Z","title":"Deep nonparametric regression on approximate manifolds: Nonasymptotic error bounds with polynomial prefactors","venue":null,"work_id":"5ec769ee-0517-4a55-9869-4499f432084f","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.993945Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:a3d72739ac2e821454ec879ea4112c26dc9ada3e9a3827f5254892d8e4a4ceac","observation_id":"ee19a9c3-727f-4005-b69f-3a01f64f7f44","resolution":{"observed_at":"2026-08-16T12:42:56.796481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:55.997891Z","title":"Approximation bou nds for recurrent neural networks with application to regression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:55.997891Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:5e9d91d2316081a0b288b4bd5756c6138265058b9b8449ff39c450b99edb915d","observation_id":"37f2d625-a612-4ca3-8f32-96aab29d616b","resolution":{"observed_at":"2026-08-16T12:42:55.997891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.779702Z","title":"Are transformers with o ne layer self-attention using low- rank weight matrices universal approximators? In International Conference on Learning Representations, 2024","venue":null,"work_id":"bdd9eadd-77ff-4db4-9867-8eee0bbb6f32","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.001480Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:466bf307b8dba490847c0d9f0fbc1a7dbd7a9bb569f8edaa242003a4809df8f2","observation_id":"836ca48a-eec6-48e8-8b00-dd9e504ba787","resolution":{"observed_at":"2026-08-16T12:42:56.784116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.764577Z","title":"On the optimal memoriza tion capacity of transformers","venue":null,"work_id":"6c00db00-ccf7-4191-b2a2-2bffccb0d09e","year":2025},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.005493Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:f9b69c6251309d5af054d4b252d129d55ec0f80cca34ff671a42c74420181f69","observation_id":"c2609ade-b76f-47f4-949c-09e04aa7f24c","resolution":{"observed_at":"2026-08-16T12:42:56.769407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.752623Z","title":"Polynomial bound s for vc dimension of sigmoidal and general pfaﬃan neural networks","venue":null,"work_id":"3f486fe4-bda1-41de-b4ff-226f0425387c","year":1997},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.009593Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:5e966b2a50da7fa131cd7c2adc14772f39fc44f9dc8e4d42911ad1412233b296","observation_id":"5a08634e-f9e1-4fa3-b77f-62b9f9d11977","resolution":{"observed_at":"2026-08-16T12:42:56.756638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.740841Z","title":"Provab le memorization capacity of transformers","venue":null,"work_id":"2bef4cac-9a80-43f8-821b-01754b9b74fb","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.014171Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:21349ab3b82ff4e4662a7f93465bb6bb76cf4c54dc33cf5094457a064e4c702a","observation_id":"682a4c6e-0e4a-40c0-92ed-9eee6bf1e9de","resolution":{"observed_at":"2026-08-16T12:42:56.745387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.726621Z","title":"On the rate of converg ence of fully connected deep neural network regression estimates","venue":null,"work_id":"a9da42e3-d8be-4343-881f-c5a415fa7223","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.017596Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:58b5d0b3d8d2e508481753675f3f63088198b66959d3559d64b4313d2078e90c","observation_id":"52bb89ee-9e9a-49ae-9eb8-d3a54c8bc699","resolution":{"observed_at":"2026-08-16T12:42:56.731339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.715290Z","title":"Generalization bo unds for non-stationary mixing processes","venue":null,"work_id":"83de05b5-7ffe-48a3-ba82-d9d5e05f0418","year":2017},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.021249Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:19ee6adda586eb4275bc264062761a053a586a76399afa94ef071b827d892f0a","observation_id":"19e00243-f212-4d39-ac11-5db056a07116","resolution":{"observed_at":"2026-08-16T12:42:56.719367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.703774Z","title":"Deep network approximation for smooth functions","venue":null,"work_id":"4ad56d3b-80ee-4ad2-aca0-598d61b219fb","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.024883Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:d9f97219b2a0e7fc0846a9c35cfbbba7f1c7aa8f9f813f7770698b9da03e306a","observation_id":"7c390cde-365f-4218-88d9-5451fb07c0ee","resolution":{"observed_at":"2026-08-16T12:42:56.708018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.691521Z","title":"Nonparametric time series prediction throug h adaptive model selection","venue":null,"work_id":"c41abacf-4662-4254-964a-171ca48d82dc","year":2000},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.028503Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:397fb26ac11c138f8f93c50e9d582519e4731c6bb4ae614da5beb00f2100c5d2","observation_id":"930ecd4b-8566-41b2-9598-7e86b98becac","resolution":{"observed_at":"2026-08-16T12:42:56.695668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.679239Z","title":"Rademacher com plexity bounds for non-iid processes","venue":null,"work_id":"d7469994-3894-42c1-a0ac-ee37dc065b7b","year":2008},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.033402Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:cd9fce829cabc97ee912dc655994829e32ff24020ab47caa1ff4acaf7dda8cc4","observation_id":"9dfacf5c-b602-49d0-af81-c61d6547fcc9","resolution":{"observed_at":"2026-08-16T12:42:56.683215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.666994Z","title":"Stability boun ds for stationary ϕ -mixing and β -mixing processes","venue":null,"work_id":"1d3edcc2-1104-488d-983b-c93d05be9323","year":2010},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.037441Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:07b38e5900c0708d4669c140b26ff2313cdbb565c12358cbd30581988eb019a1","observation_id":"40415c1c-17c9-4fe4-8e78-2f4a4eb9ece5","resolution":{"observed_at":"2026-08-16T12:42:56.671144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.654521Z","title":"Adaptive approxim ation and generalization of deep neural network with intrinsic dimensionality","venue":null,"work_id":"e8eea8f4-188a-4dcc-b706-2fa0878ab001","year":2020},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.041723Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:0f3e637ed591cebaff795fc8b1433719bc07650ef69cba883a3a3bc82c88480b","observation_id":"66d6460c-8a9e-4e8f-8076-121a0f241afe","resolution":{"observed_at":"2026-08-16T12:42:56.659233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:42:56.045419Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.045419Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:9ebb01c87ab329eb8f0ff3d64498f5741df0e4120ef41ba06754c69a8fcedb6d","observation_id":"f2d1a032-d11b-4b57-8d00-50cd0d6e72b6","resolution":{"observed_at":"2026-08-16T12:42:56.045419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.642206Z","title":"Pro vable memorization via deep neural networks using sub-linear parameters","venue":null,"work_id":"775335f6-9a3e-441c-9c31-f97e1ae1d54f","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.049245Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:7760aeba490418784941114f46a22c9aba8ce2fd2a5aba9a53c9d3361947ae77","observation_id":"57080174-cee6-4a9d-b4e7-13ed286c4eb0","resolution":{"observed_at":"2026-08-16T12:42:56.646798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.629676Z","title":"Scalable diﬀusion mod els with transformers","venue":null,"work_id":"8ca83507-397a-4070-8547-9c3cd0f93bc7","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.053675Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:e79f69f1cbed886bf64f622a401fa3b681f6fb65566b6708c32a956a151844cb","observation_id":"f0816268-ffcd-4300-8979-d29ce4be7bfa","resolution":{"observed_at":"2026-08-16T12:42:56.633986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.618403Z","title":"Atte ntion is turing-complete","venue":null,"work_id":"b0f67e2f-c7be-411e-8340-d903f76c5671","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.057256Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:0b27d980a8bd835a326b88a3806ec041b2d8aa81cb420b8932829b44c8d67a37","observation_id":"73c4d1e7-c593-4d99-b16a-0d9c2d63572f","resolution":{"observed_at":"2026-08-16T12:42:56.622000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.606385Z","title":"Promptin g a pretrained transformer can be a universal approximator","venue":null,"work_id":"3c6fc2e6-4720-4b4e-b194-17ed010ef1f7","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.060862Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:808c4ec401757ee365877027cb8ba523ce4b81bd6216c6d849190b051bd5dbc5","observation_id":"3eefdc63-6ff8-4bf9-ac16-a0981c66d1e7","resolution":{"observed_at":"2026-08-16T12:42:56.610523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.594260Z","title":"S tatistical spatially inhomoge- neous diﬀusion inference","venue":null,"work_id":"9c9374e6-8417-4dea-aa10-b8234531d82f","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.065558Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:376801c0aee86de14e0fd17a1f08deee2dc47a42dd1231cef6db516cbd4d67a4","observation_id":"6fbe2cf9-c3a1-4d4f-a935-8e32ff6de0d5","resolution":{"observed_at":"2026-08-16T12:42:56.598514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.581180Z","title":"Nonparametric regression u sing deep neural networks with relu activation function","venue":null,"work_id":"8cb6b3e0-1335-4bd9-981d-9070f0129931","year":2020},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.069603Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:1501526bcb7175b0957aa870f8ea716a867fd42f1146f6cd59eeebc6278b736a","observation_id":"5d365aed-859d-4593-8e38-34c60797d1f8","resolution":{"observed_at":"2026-08-16T12:42:56.585827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.569252Z","title":"The kolmogorov–arnold repr esentation theorem revisited","venue":null,"work_id":"d2c7fe9a-7325-479f-a666-810d03b88fd8","year":2021},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.073630Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:bf55a425d2ceb507721b0df130887243579392e601d71b4599a1772b111429b6","observation_id":"578fe9e5-76bf-4733-a866-4d709198e47f","resolution":{"observed_at":"2026-08-16T12:42:56.573068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.557454Z","title":"Predictive pac le arning and process decompositions","venue":null,"work_id":"13e816e8-f205-478b-a9ee-0429e18d077c","year":2013},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.077600Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:10a80bcbd2f1dfdfde4f5631dfe62b4463ea712570d76cf8e4aa1645f83dd715","observation_id":"ae741960-0ef8-42fd-a764-001a24fbc69e","resolution":{"observed_at":"2026-08-16T12:42:56.561364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.545740Z","title":"Deep netwo rk approximation characterized by number of neurons","venue":null,"work_id":"8760876e-f272-4dab-8fd4-4183720ab76d","year":2020},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.082636Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:c9501fa1b1f40a8da752b165b661504d0b083ebfc279d5a251bede67b16a5e11","observation_id":"5d3d2fd3-cc5e-4d81-9bf5-d98b66297bdf","resolution":{"observed_at":"2026-08-16T12:42:56.549965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.533612Z","title":"Optimal approximation rates for dee p relu neural networks on sobolev and besov spaces","venue":null,"work_id":"a3c805e5-db39-4c61-94fa-09a6ede0a07c","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.087222Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:6d2c5afae90613237d12d14455dd3e5a6abc841404d52a06006802b8a66e4da6","observation_id":"6bbe388d-39a9-4d71-908b-47c17d04f764","resolution":{"observed_at":"2026-08-16T12:42:56.537588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.521889Z","title":"Fast learning f rom non-iid observations","venue":null,"work_id":"2e9cf724-93ff-4f27-bd7e-ee01263f7300","year":2009},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.091343Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:ac441b0a9a54d7b1b1ea51663990cffbe569b1f9de9454e82dae402088bf068c","observation_id":"3ae9865f-e263-41d6-bffa-19f3b047a70f","resolution":{"observed_at":"2026-08-16T12:42:56.525753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.510047Z","title":"Optimal global rates of convergence fo r nonparametric regression","venue":null,"work_id":"86cc5353-e849-4470-b675-ccd819c863a6","year":1982},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.095958Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:5c2281ce82d68d6aaf481039777896070a5746360e016a2b814986038b1800aa","observation_id":"be952bf2-cc66-4320-84d6-4e5facc0120d","resolution":{"observed_at":"2026-08-16T12:42:56.514262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.498056Z","title":"Adaptivity of deep reLU network for learn ing in besov and mixed smooth besov spaces: optimal rate and curse of dimensionality","venue":null,"work_id":"a797695d-d6e2-44ec-a542-cbc79d829390","year":2019},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.100628Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:ee9e67ec97af7e05f99ad9db493d4b0fd15d8d3ef3e8ae51b0cbdbdf470eee2b","observation_id":"8c918bcc-87ca-48b2-969f-5c904b140bfe","resolution":{"observed_at":"2026-08-16T12:42:56.502207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.482830Z","title":"Approximation and estimation ability of transform- ers for sequence-to-sequence functions with inﬁnite dimen sional input","venue":null,"work_id":"ccb1a0e7-76ac-44ae-8eec-32d2fb663f49","year":2023},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.104740Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:535dc69e478b3939b769a5df02c235558ce5aae2fc3276e47d2421a3b6885117","observation_id":"2d1beac6-752d-44de-ace6-f10280ec9e41","resolution":{"observed_at":"2026-08-16T12:42:56.487523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11467","last_updated":"2025-02-17T05:56:11Z","snapshot_observed_at":"2026-08-20T05:00:59.101362Z","submitted_at":"2025-02-17T05:56:11Z","title":"Approximation of Permutation Invariant Polynomials by Transformers: Efficient Construction in Column-Size","version":1},"cited_work":{"arxiv_id":"2502.11467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11467","snapshot_observed_at":"2026-08-16T12:42:56.219192Z","title":"Approximation of Permutation Invariant Polynomials by Transformers: Efficient Construction in Column-Size","venue":"cs.LG","work_id":"fb537c20-3cdc-46da-85aa-baa078c8291e","year":2025},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.108910Z"},"links":{"cited_paper":"/paper/2502.11467","citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:16b5d5044673720f354ee3935b144f2bc18e9946d1b7345d551d2cebbe7abed8","observation_id":"af3e1b3e-c2bf-411d-87d6-dc5f57391df6","resolution":{"observed_at":"2026-08-16T12:42:56.225886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.469600Z","title":"Attention is all you ne ed","venue":null,"work_id":"fa90a99e-a1e8-40e3-8c6f-0ec336e50fd3","year":2017},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.113707Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:82acab09ba3db3a11969722a492888668e848742542d27416ff849c18400bb3c","observation_id":"8346c38e-d033-48bb-82c1-d8b8c96013a0","resolution":{"observed_at":"2026-08-16T12:42:56.473809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.455765Z","title":"Inequalities for absolutely regul ar sequences: application to density estimation","venue":null,"work_id":"b51ade68-f933-45f9-927b-78062583fdac","year":1997},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.118599Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:4f5d7d3341cf57719a9f42018457b3ad67a218cc7b4afc17a85465fc7de290d6","observation_id":"11068ab3-8114-4cee-aa8e-da9d3a62aa6c","resolution":{"observed_at":"2026-08-16T12:42:56.459981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.443089Z","title":"Understanding the expressive power and mechanisms of transformer for sequence modeling","venue":null,"work_id":"dc8a5c3b-57a9-4eb3-b1c8-3e7da4982285","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.123004Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:2c92dd89a063b3dcd9a710310d7193bd78079d9844b02f479bc02192a8c1545a","observation_id":"b924d342-6b6b-4715-83cf-3d92e65338a9","resolution":{"observed_at":"2026-08-16T12:42:56.447527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01405","last_updated":"2025-06-05T13:30:23Z","snapshot_observed_at":"2026-08-20T05:01:39.812999Z","submitted_at":"2024-10-02T10:31:17Z","title":"On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep Encoding","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01405","snapshot_observed_at":"2026-08-16T12:42:56.126792Z","title":"On expressive power of looped tr ansformers: Theoretical analysis and enhancement via timestep encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.126792Z"},"links":{"cited_paper":"/paper/2410.01405","citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:ae25395222fcf54c91782482cc4261fe3490eaa002c5db5ae9ef6baf9c865171","observation_id":"1ce557d4-5d09-47ce-bee9-8a70a6fe4847","resolution":{"observed_at":"2026-08-16T12:42:56.126792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.429633Z","title":"Nonparametric regress ion using over-parameterized shallow relu neural networks","venue":null,"work_id":"85073d38-5b38-4914-a709-2ba2c3cc6ebb","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.130620Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:b5647987be489cc226d7d7b522267297acf42cadfafc96ae22137b4c9d2c1837","observation_id":"219e0296-97f6-4fa9-8745-aafe2cf0db36","resolution":{"observed_at":"2026-08-16T12:42:56.433912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.417096Z","title":"Optimal rates of approx imation by shallow relu k neural networks and applications to nonparametric regression","venue":null,"work_id":"79d2d526-4396-48e9-accf-85cdb8068d9c","year":2024},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.135028Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:6dbbe4d08af15395f6738f6e1ae8249d92adff29321eedd123fda2c9b9b90469","observation_id":"d1922890-b203-44aa-bc2e-f4c0cf5a24d5","resolution":{"observed_at":"2026-08-16T12:42:56.421337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.139345Z","title":"Error bounds for approximations with deep relu networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.139345Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:e2c940fbd8c8bf745628769544e5b10460cb0907452925c3904195440cfd5b1c","observation_id":"42b5a247-128c-45f4-b598-810e84d39976","resolution":{"observed_at":"2026-08-16T12:42:56.139345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.394821Z","title":"Density estimation in the l8 norm for dependent data with applications to the gibbs sampler","venue":null,"work_id":"bdbe3186-0324-483f-ba29-7fe210d0149a","year":1993},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.143118Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:cd4f81d883d57c8a6eb4a6a089b61eee9bc746c582992934aa7abcfdb641651c","observation_id":"ba24bcd9-be68-41a1-bf25-7268f2e19f84","resolution":{"observed_at":"2026-08-16T12:42:56.398878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.383042Z","title":"Rates of convergence for empirical processes of s tationary mixing sequences","venue":null,"work_id":"64c5378f-531f-4b8f-89cf-4fc4dd7cf75f","year":1994},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.147701Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:c0de7eb78b3a7c7a125a017ce55ad69b4425934a7eff94c93c1514c25db9597f","observation_id":"6e897e4d-0e4f-4930-bff9-4baddc4b01e8","resolution":{"observed_at":"2026-08-16T12:42:56.386916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.370215Z","title":"Are transformers universal approximators of sequence -to-sequence functions? In International Conference on Learning Representations , 2019","venue":null,"work_id":"dbc22efc-1174-4e80-bd17-af55a0375f61","year":2019},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.151474Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:ca5d91cdb88933a4c55718b5e40d0e08f465271e7bcf35292e5ac1a287e725c8","observation_id":"17a9a356-a54f-4368-bf90-1f23c3966c94","resolution":{"observed_at":"2026-08-16T12:42:56.374723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.356972Z","title":"O(n) connections are expressive enough: U niversal approximability of sparse transformers","venue":null,"work_id":"cc421fd3-d241-429b-bfc4-86a9c7807f2f","year":2020},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.155970Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:28fdb9e970c800d9c725b9d836643ccf76655e52da523187e7555dcf0ac28b26","observation_id":"a6435793-e0fa-4958-ad28-62282f737375","resolution":{"observed_at":"2026-08-16T12:42:56.361520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:56.343719Z","title":"Deep netwo rk approximation: Achieving arbitrary accuracy with ﬁxed number of neurons","venue":null,"work_id":"eab81a46-84b3-4cac-a318-f04e42784185","year":2022},"citing_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:56.159870Z"},"links":{"citing_paper":"/paper/2504.12175"},"observation_digest":"sha256:1611facbe9f07cfc16d238fdf9b22aab500f8d3436de541e0809272b70e78764","observation_id":"60c77254-4b0c-4ba3-b279-001c9df36cd2","resolution":{"observed_at":"2026-08-16T12:42:56.348270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-20T04:56:16.622237Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":61},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 4 inbound Pith citation observations for arXiv:2504.12175."}