{"as_of":"2026-08-08T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d24e82fad3a5faa7a9ccac8ff841bf61c338eb641168b8bb443d388d5b835f2","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:24:18.984754Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31423/citation-record","integrity":"/paper/2605.31423/integrity","json":"/paper/2605.31423/citation-record.json","paper":"/paper/2605.31423"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"On scram- bling phenomena for randomly initialized recurrent networks.Advances in Neural Information Processing Systems, 35:18501–18513, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:a210889c1b0897f35e75db639faff649b5e39df2e3af456a04f68b304cb70e64","observation_id":"b39f9bef-c916-41b9-8dab-d4d99d3463bc","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Model reprogramming: Resource-efficient cross-domain machine learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:aeda5e31a4ef088cd3e01782d55162c313f6a6daa387e63e62da93b6231e22bb","observation_id":"27ab454d-0794-4e1e-97b2-b69546baca09","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"The lottery ticket hypothesis for pre-trained bert networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:8cfdb477f493f90e951ec42ad4f26291f2ab60ee85b13fbcec17a4f342d3b557","observation_id":"2cd8a32e-205d-49d5-a08f-f3024413ea3a","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Schützenberger","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:46fcc2b4d5d634d5f45abf7e0e273d7f76af9a9c4f72e2f5ea72bd757606c771","observation_id":"0ff3a7c0-5cdf-4cbb-84e6-eeef43cb6143","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Turing completeness of bounded-precision recurrent neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:81cd2ca3416cb1402b3dce828d34b4b1809be30cb92798207508e4af51acdd79","observation_id":"55c42335-e5b2-4364-9a98-464c603afa1e","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Approximation by superpositions of a sigmoidal function.Mathematics of Control, Signals and Systems, 2(4):303–314, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:80b6789127c0c7a39bf7ae6309badb8886fe0ac20bba8ced9fe992905cf0d10a","observation_id":"47aa43b9-25f0-480e-be23-47715ca7e624","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Uni- versal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:ac6cf0969dc7a4bb312ef5e976fac42a874fa1466b9c604b75731d6be15c0fc5","observation_id":"df515ed9-9a51-42c1-a084-be2b6fcea8f9","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:6a213bef7e5e26447c4a3eab656cdd0823b31bfeca7621a02e9984243baf424e","observation_id":"028dea82-b222-470e-bee6-0ef6955c05fe","resolution":{"observed_at":"2026-06-29T00:02:50.217756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:42ff07bec6173e3f33156ea1431e4977fa7e41a8ce2f06a5003b5a98aabd628f","observation_id":"785e7f36-9e29-44a3-a70f-a27b6bc5340c","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:df9db62e8dc740269ca388217d5624602e56a9902e491c691d869296d919b3e2","observation_id":"f559750d-91b7-4426-bbe7-477ba37a304d","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:ba85dd4426750b99eaf39c984d845eb13fe521a411650eaeb4ce0a75ba560ac3","observation_id":"492026aa-e08e-4650-b39a-a6739c73a89e","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"On the approximate realization of continuous mappings by neural networks","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:aa22bc5d89fb0bba72513a9ceb85615e5b4845c9e75cde5ee82fac64f5d2475e","observation_id":"43b2c092-4462-4b0d-ab9c-c277531dcb80","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Looped transformers as programmable computers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:ecfd11d2d6b9369b7d0350c6a4e41b713b3fd738d5eb603d4be5c04dfce897f4","observation_id":"17ce1dca-a688-4401-b7e5-d6592ea3ea1e","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Multilayer feedforward networks are universal approximators.Neural Networks, 2(5):359–366, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:bb05abca9c7aea0160876180c6a61b957fb32a0d25664be6da17e839fec168c3","observation_id":"9f2d249a-8314-4080-ab2f-ba8092f60d71","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:5e4fe24138745cd8f048619906756dc6fd3233a11f09960fcb897d134d4cce92","observation_id":"f285d7b3-c029-4e2e-ab10-26e63789eaf0","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"echo state","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:aba9e12d23afa18f920adbd16fa219cf5bb8923877a973c6482664ada56249d5","observation_id":"0044ef4b-b98c-444b-abd0-a647e32547bf","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Real-time computing without stable states: A new framework for neural computation based on perturbations.Neural compu- tation, 14(11):2531–2560, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:c4e2083256ee6b26836a5a60b8abc302ed2ea55742e344645424b60dd00db134","observation_id":"5033a629-bc10-4d20-84f7-15e27a4172af","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Priors for infinite networks","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:276706963bb3a272ce5f73843125b818af834698f3d572712228a30ea0dfb421","observation_id":"e765b4cd-8c48-4e5a-965d-47e4724a6a49","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"In-context learning and induction heads.Transformer Circuits Thread, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:ad6ebe5516127d3202347fefefa6b6d2580a6ec62de771b61d7642079661e398","observation_id":"f808248d-018d-47ac-9a18-82fe49bbeaca","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"The strong lottery ticket hypothesis for multi-head attention mechanisms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:88573b06aa203acdec46d41c4abffa583ff01041dce528abf108823e097731eb","observation_id":"f5ed6b84-e40e-4603-9703-5207be7ee245","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Random features for large-scale kernel machines","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:fae84522840e4abe4d37a278a728a3d2a672bef9196f3abc6a069e9b9daa2cbc","observation_id":"6d0be849-3e0c-413c-966a-a4243f8f4804","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:a00f6e5a8d92872a8898bbb4206feb5f9a2f98dcb4522710c3135607fc4ba22d","observation_id":"83fe68b5-c459-4489-9cee-664cf075ea2f","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"On the computational power of neural nets","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:38e6cbd9de79d9d911e44805ca128261e7347e8741a8c34140ecacc9d52fbe01","observation_id":"8b759546-2cbd-4c3c-b72e-58591d956aa5","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":null,"venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:702caa64c03c2c24a4de5c527dfeec87f02f525597c77e401f949e4195b149bb","observation_id":"97cd2dd1-00f9-4983-9f55-8978d707f7bc","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Universal circuits (preliminary report)","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:b2c45c6d1f4acdc10a30e6c97715860881221e9961341dcf15f740c423185afa","observation_id":"56089b7b-0745-4b24-a28d-02b7943703d6","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Statistically meaningful approximation: a case study on approximating turing machines with transformers.Advances in Neural Information Processing Systems, 35:12071–12083, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:3c9b6596bae1247e0a0779924bfdb7be259fac5ff6ee608cf8c8f786738b913b","observation_id":"dc555fa8-b900-4f62-b599-659767e16bfd","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"V oice2series: Reprogramming acoustic models for time series classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:0271def4d042737c25d364bcc3f7125bf76899719da2713f28bc65b3a0616abd","observation_id":"cf5f2db0-1fb7-4b66-b4e9-4598303c4fef","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Self-attention networks can process bounded hierarchical languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:e2178e5d69a99308fafe8d4d68d7ff0441ce9747c27de1bab64a617b5a2a94b4","observation_id":"da1263e1-73d8-43a7-b105-d144f5edc615","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.292","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://acla nthology.org/2021.acl-long.292/","venue":null,"work_id":"3232fc5d-4daa-4db3-a4ba-86ece341abaf","year":2021},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:c7d7b4a9459d37d26f081058da6202fa68f74738a46104b14d60fed2082cf45c","observation_id":"4d411aa7-84f3-44a2-8469-fcab6c74e825","resolution":{"observed_at":"2026-06-28T23:32:46.868059Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"Are transformers universal approximators of sequence-to-sequence functions? InInternational Conference on Learning Representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:1c6bf1aa8755d2585901131c114f198495442ff418a573b084f0d57a5aa8d4d5","observation_id":"5427f25e-d3a2-4b73-99cf-af5f8af089f8","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:24:18.984754Z","title":"?” followed by the target answer token. The answer is “)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:e324ad7a62b513c4d55bb369349daa14e65dfe8c8e73837d14cf04baaf61f013","observation_id":"21b7bbe2-fb03-4ab6-8cb8-57bdf34bee39","resolution":{"observed_at":"2026-06-28T23:24:18.984754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2605.31423."}