{"as_of":"2026-08-07T20:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ac66d25cda5bb4fc4c2f3b7ba525c98bf65cc017d2f72d3e38c8372a4678b8d","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:22.908318Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:15:07.096284Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:56:47.880747Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-02T13:13:12.421550Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:47619de4f1283a8fe85cfd6616bb1720efa4e469ffaf42ba6265a93b2b29b26f","observation_id":"1a7b7cd7-c4d6-4a78-9f4e-10c11430db8b","resolution":{"observed_at":"2026-05-21T23:10:44.852070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-08-05T13:15:07.096284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00925","last_updated":"2025-08-31T16:21:21Z","snapshot_observed_at":"2026-08-06T23:39:11.301413Z","submitted_at":"2025-08-31T16:21:21Z","title":"DTRNet: Dynamic Token Routing Network to Reduce Quadratic Costs in Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:15:07.096284Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2509.00925"},"observation_digest":"sha256:b2aaf81eb4b5607d8df5af06fba3858c2b495f122f4ab256d7a8d1eab6c53ba7","observation_id":"25956d3d-2ece-4dbc-bcf9-d6d2a8a4b5f6","resolution":{"observed_at":"2026-08-05T13:15:07.096284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2512.12744","last_updated":"2026-05-21T01:18:21Z","snapshot_observed_at":"2026-08-07T14:28:26.092742Z","submitted_at":"2025-12-14T15:47:40Z","title":"Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T22:19:25.483640Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2512.12744"},"observation_digest":"sha256:87ee134710e35c7066121d824abec5ff706df5674ce05e86540f928167ae6f9c","observation_id":"b9087432-cd4e-42a1-8b5b-3fa872b1f2c0","resolution":{"observed_at":"2026-05-16T22:21:19.053632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2512.12744","last_updated":"2026-05-21T01:18:21Z","snapshot_observed_at":"2026-08-07T14:28:26.092742Z","submitted_at":"2025-12-14T15:47:40Z","title":"Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T11:54:29.436149Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2512.12744"},"observation_digest":"sha256:d104cd48ee99dc77f008f2e91f7a8679b5b794530d5ede23c045a64e8bac8ab8","observation_id":"5cd2c773-03ed-4a2b-a62c-a709c6b164d2","resolution":{"observed_at":"2026-05-22T11:54:51.174733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-08-03T06:55:10.047706Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer.arXiv preprint arXiv:2506.01115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21725","last_updated":"2026-05-27T19:52:53Z","snapshot_observed_at":"2026-08-04T21:23:57.701786Z","submitted_at":"2026-01-29T13:48:43Z","title":"Procedural Pretraining: Warming Up Language Models with Abstract Data","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:55:10.047706Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2601.21725"},"observation_digest":"sha256:bd35ea71addf820d471ac12f26f1ec95947722458f821ec786c00ed034924cf6","observation_id":"2ef29a84-3c61-4c99-a577-712726e622bb","resolution":{"observed_at":"2026-08-03T06:55:10.047706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2604.27914","last_updated":"2026-04-30T14:20:16Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:20:16Z","title":"Geometry-Calibrated Conformal Abstention for Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T05:56:03.031192Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2604.27914"},"observation_digest":"sha256:67d12f4662e595dd343b741c779a92014563c598d94ce052d854cb39fb69e2f7","observation_id":"5c3d438d-9afd-463d-93e2-61c7f1e8720e","resolution":{"observed_at":"2026-05-12T10:31:28.657564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-02T05:01:10.127507Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T11:47:41.717389Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:d820c21e65a1d4f7f903aa8d7f8ae418b365170f7428741d370a482263e39a41","observation_id":"3103343d-d627-4c1d-b9a7-94dba112716b","resolution":{"observed_at":"2026-05-11T19:31:08.807728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-02T05:01:10.127507Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T07:15:02.755541Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:eabfbbcf540c499b607eebd665ac1b50036fe49ff34c18cfdbcce4e3903944b5","observation_id":"b314efdc-8adb-44b0-8ae0-3031b2ecdab7","resolution":{"observed_at":"2026-05-15T07:15:11.538789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-15T11:17:06.440358Z","title":"Attention retrieves, MLP memorizes: Disentangling trainable components in the transformer.CoRR, abs/2506.01115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-02T05:01:10.127507Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T11:17:06.440358Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:b03c3c655a810442a8e185c518d572381642c61eac5f76b85ef8f7cc07934c36","observation_id":"20037440-1bb0-4963-9551-f74d7b62b213","resolution":{"observed_at":"2026-07-15T11:17:06.440358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:ff67b79a277eed8fa893e1d4bb764ad47f8b242f2c409d3c189802e9e7494fdc","observation_id":"028dea82-b222-470e-bee6-0ef6955c05fe","resolution":{"observed_at":"2026-06-29T00:02:50.217756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2606.05134","last_updated":"2026-06-03T17:39:29Z","snapshot_observed_at":"2026-08-07T13:41:23.080938Z","submitted_at":"2026-06-03T17:39:29Z","title":"Activation-Based Active Learning for In-Context Learning: Challenges and Insights","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T06:27:29.827899Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2606.05134"},"observation_digest":"sha256:620dcd4746fbf46b3244ad151a55efcf27ef12eb7aa057d4c5102b31e0235d53","observation_id":"8dbf2c27-2496-441f-bdef-32e954d60dcf","resolution":{"observed_at":"2026-07-02T07:56:47.882218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01115/citation-record","integrity":"/paper/2506.01115/integrity","json":"/paper/2506.01115/citation-record.json","paper":"/paper/2506.01115"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T11:57:22.571092Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.571092Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:0d08c8a3cbd4050600e98f08e34c52f471b591c7509c9fcb95aa735ae65b4a77","observation_id":"8363ba87-329c-42c9-9ecc-0a23659bea68","resolution":{"observed_at":"2026-08-07T11:57:22.571092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14019","last_updated":"2023-02-23T14:54:05Z","snapshot_observed_at":"2026-08-05T19:16:46.142873Z","submitted_at":"2022-10-25T13:41:31Z","title":"The Curious Case of Benign Memorization","version":3},"cited_work":{"arxiv_id":"2210.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14019","snapshot_observed_at":"2026-08-07T11:57:23.697420Z","title":"The Curious Case of Benign Memorization","venue":"cs.LG","work_id":"f5c683d1-89bd-42ac-9a1d-697f6f69102c","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.577524Z"},"links":{"cited_paper":"/paper/2210.14019","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2b38f4e0223c9c7dfd4f5706c6641a1fcc9ad98c02492654ef08090f155ed047","observation_id":"e9abca2d-5c2b-440f-9692-f09073b1fa79","resolution":{"observed_at":"2026-08-07T11:57:23.702593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.153753Z","title":"Du, Wei Hu, Zhiyuan Li, Ruslan Salakhutdinov, and Ruosong Wang.On exact computation with an infinitely wide neural net","venue":null,"work_id":"d19cfcca-40ae-4e7f-8baa-43bfaa3a79c2","year":2019},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.583250Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:023851bfc14967642c792212acf9a7d46918c41fb0ea30e0584b750390c6c430","observation_id":"73175888-b0e0-4f1b-a063-df84c3ac5ce3","resolution":{"observed_at":"2026-08-07T11:57:24.158136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.137789Z","title":"A closer look at memorization in deep networks","venue":null,"work_id":"71c7d1eb-7674-43db-bd69-230dff1f5047","year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.588325Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:c7c59323c67af03dec744c069603adc797b63875a02394e38aa835a2426fbd84","observation_id":"e41ea57a-c370-4585-bf0c-5511b8b9b17a","resolution":{"observed_at":"2026-08-07T11:57:24.143410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.117662Z","title":"Scaling mlps: A tale of inductive bias","venue":null,"work_id":"3e44bde6-b809-4f9a-884f-00a692da34f5","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.593277Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:925142bf18b93274fcc3167271558db743c8c7e62870f0b028b757bc9e91fbc2","observation_id":"117151e8-5cca-4bda-b64b-6e54be0079b1","resolution":{"observed_at":"2026-08-07T11:57:24.123851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.599011Z","title":"Mechanistic interpretability for AI safety - a review.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.599011Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:530ac6797ba46d401669890965d32706178a57c52e08c4ee19b1e4018d4d354c","observation_id":"879bb15d-bee3-410b-a93f-0189690761f1","resolution":{"observed_at":"2026-08-07T11:57:22.599011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.091883Z","title":"Birth of a transformer: A memory viewpoint.Advances in Neural Information Processing Systems, 36:1560–1588, 2023","venue":null,"work_id":"7b3fa38c-d86f-4dc2-8e3f-b472664017a8","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.605192Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:867d9006f5c0c3ebcf105c5bbbeceec0b454b6390726d6f201c2e5e0a897d4ea","observation_id":"0ea2cbf4-4bb5-4b85-af8e-f660e06859a4","resolution":{"observed_at":"2026-08-07T11:57:24.096487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10735","last_updated":"2025-04-17T12:53:23Z","snapshot_observed_at":"2026-08-07T16:05:43.591788Z","submitted_at":"2025-04-14T22:06:24Z","title":"Frozen Layers: Memory-efficient Many-fidelity Hyperparameter Optimization","version":2},"cited_work":{"arxiv_id":"2504.10735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10735","snapshot_observed_at":"2026-08-07T11:57:23.523173Z","title":"Frozen Layers: Memory-efficient Many-fidelity Hyperparameter Optimization","venue":"cs.LG","work_id":"bc86d0b6-352c-4e46-a000-3d103cf90a2f","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.611391Z"},"links":{"cited_paper":"/paper/2504.10735","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:0f17bacc913560fc660ba6adcee7728b54408b9edc36adf2cb28fe1a8f8db539","observation_id":"662cb06e-280c-496c-b623-4dc346d22452","resolution":{"observed_at":"2026-08-07T11:57:23.631525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05675","last_updated":"2022-10-13T14:06:09Z","snapshot_observed_at":"2026-08-06T08:59:00.500125Z","submitted_at":"2022-10-11T09:29:19Z","title":"Transformers generalize differently from information stored in context vs in weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05675","snapshot_observed_at":"2026-08-07T11:57:22.619625Z","title":"Transformers generalize differently from information stored in context vs in weights.arXiv preprint arXiv:2210.05675, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.619625Z"},"links":{"cited_paper":"/paper/2210.05675","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:5f42ac87e63bf1856781b1ca3c7063c67da8fe88bbd4bce5ff1bc95cd8ba15d9","observation_id":"3191c054-6843-42be-a1a1-84be8dbd1f98","resolution":{"observed_at":"2026-08-07T11:57:22.619625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.077646Z","title":"Distributional associations vs in-context reasoning: A study of feed-forward and attention layers.ICLR, 2024","venue":null,"work_id":"49952b80-d0d0-44ee-90d3-f198cd4a31ee","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.626924Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1c4511dae928aa72e5e3eb0bb9955224c24b6542c2b771bd8b3701fc8e421a93","observation_id":"30c7a563-58a0-4209-ae7e-594a24231996","resolution":{"observed_at":"2026-08-07T11:57:24.082310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.063936Z","title":"Knowledge localization: Mission not accomplished? enter query localization! InProceedings of the Thirteenth International Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":"7b6feb02-b74a-4511-99b2-10564fec711e","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.633098Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:59da794ea3737ffc660aeb11b1b1200ab1beefce38faa1fb68f44fef351eeb8d","observation_id":"68fa1850-9619-4b11-837e-0cf11690ca00","resolution":{"observed_at":"2026-08-07T11:57:24.068319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.049984Z","title":"Summing up the facts: Additive mechanisms behind factual recall in llms, 2024","venue":null,"work_id":"3132c393-201d-4817-9109-4af4fd628536","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.639502Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:823b676ff6b9cb83b0ad151e4e6f347cdc568c71e1226585717792064b853b41","observation_id":"8ca9d54d-76bd-4019-af87-fba6bb10bc3e","resolution":{"observed_at":"2026-08-07T11:57:24.054015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.036407Z","title":"Induction heads as an essential mechanism for pattern matching in in-context learning","venue":null,"work_id":"228eb341-419a-4bb9-99dd-6a408ed836bc","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.647499Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d81a8acae46dfa4df85f34a9917e0a49d09d09e9febb29dc14a3ef03f5c1d222","observation_id":"1e846ff2-6ed8-4deb-8034-b1fb20869d90","resolution":{"observed_at":"2026-08-07T11:57:24.040339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.655162Z","title":"Knowledge neurons in pretrained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.655162Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1e1f2a169eb3daea94c422a21a1cffd0c0d04d6978ebedff79daa19cd7eac8e7","observation_id":"83408a97-f0ab-447b-a5e6-c01f0c6a15c1","resolution":{"observed_at":"2026-08-07T11:57:22.655162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.021866Z","title":"Attention is not all you need: Pure attention loses rank doubly exponentially with depth","venue":null,"work_id":"8bc114b8-c949-4432-a5a1-06c265675962","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.661558Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:7bd30879e46334d044c35e928b5c26039a99cb552becc381a538068b923a2e9d","observation_id":"44cc6a85-ddda-418d-9e36-2645fb4adb39","resolution":{"observed_at":"2026-08-07T11:57:24.027077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:57:22.667162Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.667162Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:8a484ca0b050cb885fd4a0497b5083394ea02a37ad5d2a7548b380ffe3dceef1","observation_id":"28cc1dae-114a-43c7-a596-2b6d94072207","resolution":{"observed_at":"2026-08-07T11:57:22.667162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.003372Z","title":"Edelman, eran malach, and Surbhi Goel","venue":null,"work_id":"0e2bf7cf-731b-4df6-9a21-ceeddb837410","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.672227Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:01b6ace4c8d60fd1c6f85c7c716559a63e07b690dc1d1849444ab404bbca469c","observation_id":"1d511882-7077-4c50-b2ab-5aa70f144bfa","resolution":{"observed_at":"2026-08-07T11:57:24.008710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.984804Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 2021","venue":null,"work_id":"087f3a1e-2b27-4ee8-b3a6-62910f52d4b8","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.677623Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1327a4f0f5cbdfb1990f91372f54e86bda7629fa4d8ceeeaac409f71e1b213cf","observation_id":"6de929e4-298d-4f9f-bd46-dcf17694bbd6","resolution":{"observed_at":"2026-08-07T11:57:23.989975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-02T07:29:08.108809Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-07T11:57:22.682505Z","title":"Transformer feed-forward layers are key-value memories.arXiv preprint arXiv:2012.14913, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.682505Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:40df797daeb45b742e4d4b7186a082bfedf874c1bf831394c76577f2b48fd435","observation_id":"58bf9a70-406d-4f25-8238-7eedfc9358da","resolution":{"observed_at":"2026-08-07T11:57:22.682505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.687732Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.687732Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:829211ee9e3f4e8b92e2201efdf53cfb03889f2cb63b1e1bf34471a00ed56064","observation_id":"c47962c0-f560-41db-b6ee-fa5f74c6d609","resolution":{"observed_at":"2026-08-07T11:57:22.687732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.692163Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.692163Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:a8f3a505431642bde5ad3b8b3c2774d05f2640c209a6c4449a437053e5bdf7b9","observation_id":"c0f87075-542c-4a28-afc8-718b2ecba1d3","resolution":{"observed_at":"2026-08-07T11:57:22.692163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.696572Z","title":"Dissectingrecalloffactualassociations inauto-regressivelanguagemodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.696572Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:7e4ff909a3865f9d9d7a907c392e5bc9de8894c5991ad261633c76a8981a6fb7","observation_id":"2dc95dbb-4299-4414-a852-483b5d696015","resolution":{"observed_at":"2026-08-07T11:57:22.696572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:57:22.701367Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.701367Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:3779b4886a46546d9688f320dfe11c3e882156e33821164721daa586b9c0070f","observation_id":"a3e0fa06-aee0-48fa-b920-79811df9a4f2","resolution":{"observed_at":"2026-08-07T11:57:22.701367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.969877Z","title":"Smith, and Roy Schwartz","venue":null,"work_id":"a93a9465-0d1d-4f4b-8434-d43f33603aab","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.705870Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b26d798dfc2d9d2461f4bc025c575f568f5419bae754bda6e54f5432c9f74873","observation_id":"9631f467-18cd-46a7-aa33-fb364dfc04cf","resolution":{"observed_at":"2026-08-07T11:57:23.974388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01906","last_updated":"2024-05-31T11:14:16Z","snapshot_observed_at":"2026-07-06T16:42:40.074343Z","submitted_at":"2023-11-03T13:30:52Z","title":"Simplifying Transformer Blocks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01906","snapshot_observed_at":"2026-08-07T11:57:22.710780Z","title":"Simplifying transformer blocks.arXiv preprint arXiv:2311.01906, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.710780Z"},"links":{"cited_paper":"/paper/2311.01906","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:34fed603f01df2e0c112ef3abc6d606cab8258b7eb4cd00987958d7630ecb8b9","observation_id":"2849f7ac-531f-4d2e-9980-80ffde91facd","resolution":{"observed_at":"2026-08-07T11:57:22.710780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12786","last_updated":"2024-08-21T16:37:20Z","snapshot_observed_at":"2026-07-06T16:50:42.754354Z","submitted_at":"2023-11-21T18:51:04Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12786","snapshot_observed_at":"2026-08-07T11:57:22.716704Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks.arXiv preprint arXiv:2311.12786, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.716704Z"},"links":{"cited_paper":"/paper/2311.12786","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:a4b216732ca58129ca81cef0db62a1fea31a40f36396f487d06993b3c1165f58","observation_id":"20848180-274a-4d69-a981-68c6b2675f35","resolution":{"observed_at":"2026-08-07T11:57:22.716704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.722380Z","title":"What is the best multi-stage architecture for object recognition? In2009 IEEE 12th International Conference on Computer Vision, pages 2146–2153, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.722380Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:f65148dee4c27f9d97207902b5a07ee5b871c78844fb6170f3f166c16116f427","observation_id":"547444a1-677d-4f56-a61f-815b88a3eef3","resolution":{"observed_at":"2026-08-07T11:57:22.722380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.956063Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries, 2024","venue":null,"work_id":"8cbd1e8d-9b5f-462f-991f-5c9eb7c8b031","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.728573Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:804c39e9387e8a8636827dbc8e3d07443182f70aa888c42cd57f7e838e6bc2ee","observation_id":"657d772e-82b4-4721-82b6-807cdc2c3692","resolution":{"observed_at":"2026-08-07T11:57:23.960220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00165","last_updated":"2018-03-03T00:45:00Z","snapshot_observed_at":"2026-08-04T10:06:19.819372Z","submitted_at":"2017-11-01T02:13:25Z","title":"Deep Neural Networks as Gaussian Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00165","snapshot_observed_at":"2026-08-07T11:57:22.735092Z","title":"Deep neural networks as gaussian processes.arXiv preprint arXiv:1711.00165, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.735092Z"},"links":{"cited_paper":"/paper/1711.00165","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:e9ee8e58b6c843adf55f8d647ad055be957bc140b8131ec98e30d7327468ca9d","observation_id":"1487f04a-6d72-4d38-87fd-03cc49bd03a7","resolution":{"observed_at":"2026-08-07T11:57:22.735092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03824","last_updated":"2022-05-26T18:50:20Z","snapshot_observed_at":"2026-08-03T17:35:52.520891Z","submitted_at":"2021-05-09T03:32:48Z","title":"FNet: Mixing Tokens with Fourier Transforms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03824","snapshot_observed_at":"2026-08-07T11:57:22.740900Z","title":"Fnet: Mixing tokens with fourier transforms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.740900Z"},"links":{"cited_paper":"/paper/2105.03824","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2fb608a6e7504bdfc280c1a8cdf4854047bea7812f4d7bef7d5b9350b63c1715","observation_id":"712c06fc-030a-4711-a0f1-dbb80d30ae53","resolution":{"observed_at":"2026-08-07T11:57:22.740900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.940942Z","title":"The neural covariance sde: Shaped infinite depth-and-width networks at initialization.Advances in Neural Information Processing Systems, 35:10795–10808, 2022","venue":null,"work_id":"f972cb0c-cdd9-4f72-ba7b-6cee810a9303","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.745978Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:31e54909815b866619179b4f448e79aa1dccb511954fb867b8f0f30efdb781fd","observation_id":"5c2b73b7-af45-463d-9a16-cae3f6618d03","resolution":{"observed_at":"2026-08-07T11:57:23.946050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01765","last_updated":"2021-10-05T00:49:36Z","snapshot_observed_at":"2026-08-04T07:37:13.014261Z","submitted_at":"2021-10-05T00:49:36Z","title":"Rapid training of deep neural networks without skip connections or normalization layers using Deep Kernel Shaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01765","snapshot_observed_at":"2026-08-07T11:57:22.750524Z","title":"Rapid training of deep neural networks without skip connections or normalization layers using deep kernel shaping.arXiv preprint arXiv:2110.01765, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.750524Z"},"links":{"cited_paper":"/paper/2110.01765","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fb4083712c5bfdcccac4523aa845f7c37054eb3091faaf5409e9c40d717daf56","observation_id":"59b06326-5916-47b7-9a17-d49c8b382d79","resolution":{"observed_at":"2026-08-07T11:57:22.750524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-07T11:57:22.755732Z","title":"Locating and editing factual knowledge in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.755732Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d954ba129a4bfe6f720702fa63c13b6fedbc0ca0903f839ca361368c13b37da8","observation_id":"f8d18586-9ccc-4f75-92cb-096e3db23870","resolution":{"observed_at":"2026-08-07T11:57:22.755732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T11:57:22.760917Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.760917Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:77bdc2a9ad8285493b0e5f8d9062f2c85350b4d1cfbcc655ea8af2cc90c4c0d6","observation_id":"a0aca01b-a1f7-4fd7-a5da-eabfdb3d31f5","resolution":{"observed_at":"2026-08-07T11:57:22.760917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.922524Z","title":"Language models implement simple word2vec-style vector arithmetic, 2024","venue":null,"work_id":"c5b1785a-7842-46a7-8e1c-c3e3925ef208","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.765913Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1c0787f0ddc672b6ae6ff423b103a67711cd3499d4bf05f20fff57f307afc652","observation_id":"1565742c-8d44-47e6-a5d7-46ce1da0bc03","resolution":{"observed_at":"2026-08-07T11:57:23.927859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.901841Z","title":"Universal approximation property of random neural networks","venue":null,"work_id":"8e21356f-fd9c-48d7-9063-31f4d19a80c4","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.771350Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:16c35749b4462a1761f22d008c931d3bf0b2836ef3d5c1068006ad1b5f38084f","observation_id":"80ff018a-334f-4a56-abb3-99e13bcdbd6a","resolution":{"observed_at":"2026-08-07T11:57:23.911077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.775855Z","title":"Signal propagation in transformers: Theoretical perspectives and the role of rank collapse.Advances in Neural Information Processing Systems, 35:27198–27211, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.775855Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:307ba3aa9f885515343b19c40db9fb7346e394a8a061f7ca53f0d777ecef6c1d","observation_id":"21a9c1d6-595c-4cb0-9df0-32949282d797","resolution":{"observed_at":"2026-08-07T11:57:22.775855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.875386Z","title":"The shaped transformer: Attention models in the infinite depth-and-width limit.Advances in Neural Information Processing Systems, 36:54250–54281, 2023","venue":null,"work_id":"2a1193c6-abec-4614-a430-e039c0efd359","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.780004Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:63f49e8355897867a70d6208b0267326b9d016031c73d33133e9b003f8808113","observation_id":"2d5c8a7b-2e2e-4611-8957-ff5225150e0b","resolution":{"observed_at":"2026-08-07T11:57:23.880239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.13019","last_updated":"2021-04-12T19:58:27Z","snapshot_observed_at":"2026-07-06T10:44:41.248976Z","submitted_at":"2021-02-25T17:22:53Z","title":"Investigating the Limitations of Transformers with Simple Arithmetic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.13019","snapshot_observed_at":"2026-08-07T11:57:22.784025Z","title":"Investigating the limitations of transformers with simple arithmetic tasks.arXiv preprint arXiv:2102.13019, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.784025Z"},"links":{"cited_paper":"/paper/2102.13019","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b374753b9550c8af8a2a6913d42777a23e9724f3f1019f37873a8f0ff71f6b63","observation_id":"dbacfc98-69da-4b05-ac89-594e5b700859","resolution":{"observed_at":"2026-08-07T11:57:22.784025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T11:57:22.788567Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.788567Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:f9303fa7209ae5a95ba1455ba6436018943fda5899da13c791a04c537efe895e","observation_id":"0211457a-d6c4-426d-b890-b1f416dfa5b7","resolution":{"observed_at":"2026-08-07T11:57:22.788567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T11:57:22.793335Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.793335Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:dfa5120b8658dc5987e8f277b3fea1f04fe25b6115c228c96fe804826dab0dfb","observation_id":"6a25774c-81d1-49bd-bc77-47473673ab53","resolution":{"observed_at":"2026-08-07T11:57:22.793335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-07T11:57:22.798604Z","title":"Mechanistic design and scaling of hybrid architectures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.798604Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1dc1e26178b1275cb18c3a6be3e1a91427d3fc33b65d60d68e154893816793f1","observation_id":"7dcd428a-9b5d-4e5f-987c-30bbdeab8320","resolution":{"observed_at":"2026-08-07T11:57:22.798604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.804007Z","title":"Exponential expressivity in deep neural networks through transient chaos.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.804007Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:c96eba210426991c80184c529ed9cc4e7a15150a822a4c221c7fafca2588a60d","observation_id":"021dc086-0b6c-4db4-8065-c4b2caa7fd2e","resolution":{"observed_at":"2026-08-07T11:57:22.804007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12997","last_updated":"2024-02-05T23:29:12Z","snapshot_observed_at":"2026-07-06T16:50:50.547528Z","submitted_at":"2023-11-21T21:16:54Z","title":"Compositional Capabilities of Autoregressive Transformers: A Study on Synthetic, Interpretable Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12997","snapshot_observed_at":"2026-08-07T11:57:22.808829Z","title":"Compositional capabilities of autoregressive transformers: A study on synthetic, interpretable tasks.arXiv preprint arXiv:2311.12997, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.808829Z"},"links":{"cited_paper":"/paper/2311.12997","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:282491877e23bb1604b8c1ec213de3e854609beeeea6faf0de2d037bbcd78e83","observation_id":"5569d08c-f9ac-48ce-88af-7ae4d248fd97","resolution":{"observed_at":"2026-08-07T11:57:22.808829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09268","last_updated":"2024-02-14T15:54:55Z","snapshot_observed_at":"2026-07-06T17:30:03.953345Z","submitted_at":"2024-02-14T15:54:55Z","title":"Transformers, parallel computation, and logarithmic depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09268","snapshot_observed_at":"2026-08-07T11:57:22.814818Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.814818Z"},"links":{"cited_paper":"/paper/2402.09268","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2d43cc33f37403eef1ab4a6d2935af2598535b3cd60ce9c47daf89456b7692ce","observation_id":"dd623bde-0640-418a-83e6-52d2867d6da9","resolution":{"observed_at":"2026-08-07T11:57:22.814818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.849921Z","title":"Saxe, Pang Wei Koh, Zhenghao Chen, Maneesh Bhand, Bipin Suresh, and Andrew Y","venue":null,"work_id":"e4735a2d-116b-4de0-b54f-4c5a64c03d09","year":2011},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.819921Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:ec6e466062eb65409a987c5c627e3ba9202936993aaff25f9756bf79ff44c82d","observation_id":"11d2c10c-c4bd-4ca0-97d0-bf2ca5d19531","resolution":{"observed_at":"2026-08-07T11:57:23.855012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01232","last_updated":"2017-04-04T19:36:14Z","snapshot_observed_at":"2026-07-06T05:17:20.642708Z","submitted_at":"2016-11-04T00:44:32Z","title":"Deep Information Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01232","snapshot_observed_at":"2026-08-07T11:57:22.825593Z","title":"Deep information propagation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.825593Z"},"links":{"cited_paper":"/paper/1611.01232","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:27e8243c38822e5caa8d20608375dbd3fa9f055c5b353d824ee32eebf9923412","observation_id":"4aaf9a34-45f3-46e3-bf4c-199425e2134a","resolution":{"observed_at":"2026-08-07T11:57:22.825593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.830990Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.830990Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:ca0a3e9523be738b4b7c8c695415787f6a442ceb2a872fd3cf85ecd4942c58fe","observation_id":"3eaae48b-ba2b-486d-a579-8517c8271da9","resolution":{"observed_at":"2026-08-07T11:57:22.830990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.822504Z","title":"Synthesizer: Rethinking self-attention in transformer models","venue":null,"work_id":"4164c214-b52b-413f-a239-cd8726d39d15","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.836163Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:c27dcb81371d4001449c8f1e5f85d885cb8a4260e1c2b09e5b218706ccc53c59","observation_id":"a6875d19-b787-4d3f-a7f3-4611c9930bcd","resolution":{"observed_at":"2026-08-07T11:57:23.827631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-05T21:57:04.021766Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-07T11:57:22.842653Z","title":"Efficient transformers: A survey, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.842653Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:9f8bdcf8adefdb530715880526519081f47ce513db1865a7931422c8c3b60f6b","observation_id":"63bf97f3-c7f4-429d-99be-880d433f5eb0","resolution":{"observed_at":"2026-08-07T11:57:22.842653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:57:22.848934Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.848934Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:31938394c5c0d60b0ee613b956189980d0fb1427bb75e9a2e92ee1891dcdadbd","observation_id":"b34f8d58-6c3e-4c0d-99b8-b42f47b9359d","resolution":{"observed_at":"2026-08-07T11:57:22.848934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:57:22.853190Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.853190Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b84e6d6762b0e1a2f5636e5f2d2a2fd8a02089a1516b7a0301dd9eb5c3a70304","observation_id":"0d52af51-62e5-487e-b502-cf2f62f01f67","resolution":{"observed_at":"2026-08-07T11:57:22.853190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.858670Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.858670Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1477faade804ff72c1614a460f0c39ca9f941f98e984616555584ee028333d4b","observation_id":"dc020708-d608-41be-92e3-0f469d4e5e57","resolution":{"observed_at":"2026-08-07T11:57:22.858670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.862990Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.862990Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:0a6b2c54a84d42e986e0442cd66ed334a327e23c14df113586934cd83b6d50d3","observation_id":"d3defb31-0d36-4736-8d53-77758ef0d9be","resolution":{"observed_at":"2026-08-07T11:57:22.862990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.867299Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.867299Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2640d83ed24da9ce6e35f80d3a044413c094320cef27ad1388bf8e95089d7e27","observation_id":"096338b0-aec6-4fa4-8739-8d2059421669","resolution":{"observed_at":"2026-08-07T11:57:22.867299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.778128Z","title":"Mean field residual networks: On the edge of chaos.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"584b6f66-4d2a-4f90-b61e-988a30116582","year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.872566Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:5339f7d02262d94487e8f0c8646bea91e98caa87736b53159faf3e711427e014","observation_id":"e41da55c-0d29-4096-a942-585c53b48eb9","resolution":{"observed_at":"2026-08-07T11:57:23.782386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17969","last_updated":"2025-01-03T16:41:37Z","snapshot_observed_at":"2026-07-06T18:21:09.808086Z","submitted_at":"2024-05-28T08:56:33Z","title":"Knowledge Circuits in Pretrained Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17969","snapshot_observed_at":"2026-08-07T11:57:22.877534Z","title":"Knowledge circuits in pretrained transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.877534Z"},"links":{"cited_paper":"/paper/2405.17969","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:e0f33266a364294ce0d018afc3aade01b276e69082f5355700ba96a61158e7ea","observation_id":"62a6dff9-fa4b-41a5-83b7-798521dfa5b2","resolution":{"observed_at":"2026-08-07T11:57:22.877534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.763428Z","title":"Locating factual knowledge in large language models: Exploring the residual stream and analyzing subvalues in vocabulary space, 2024","venue":null,"work_id":"c2214af2-cc19-47c6-9011-a3e70591169e","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.882846Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:dbdfb02715e734207f59dc8257612545b932df5bc1e1ba66c3437fc4fd0eaca6","observation_id":"04f9a6a8-d1a4-4ed3-a4b2-cb39ecf1b7a0","resolution":{"observed_at":"2026-08-07T11:57:23.768403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.749574Z","title":"Are transformers universal approximators of sequence-to-sequence functions? InInternational Conference on Learning Representations, 2020","venue":null,"work_id":"ecca1633-1888-4583-b8b6-a0daa0709cff","year":2020},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.887654Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:42677515a0726190185d069f2750a5382cbfa6c4dfeb5d38a4476867a1d425c2","observation_id":"56cf4fe1-77de-43a9-a710-6a90ec70ae58","resolution":{"observed_at":"2026-08-07T11:57:23.753867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-07T11:57:22.891916Z","title":"Understanding deep learning requires rethinking generalization.arXiv preprint arXiv:1611.03530, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.891916Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2aa01aaea394c5cd50d4a998ccf64c9ca92211160e3441666e5ccb371643beeb","observation_id":"82e33590-6882-4b6a-9e7f-16ecdf82cd1a","resolution":{"observed_at":"2026-08-07T11:57:22.891916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08120","last_updated":"2022-03-15T17:49:08Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T17:49:08Z","title":"Deep Learning without Shortcuts: Shaping the Kernel with Tailored Rectifiers","version":1},"cited_work":{"arxiv_id":"2203.08120","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08120","snapshot_observed_at":"2026-08-07T11:57:23.004485Z","title":"Deep Learning without Shortcuts: Shaping the Kernel with Tailored Rectifiers","venue":"cs.LG","work_id":"a82c6d7a-b025-4eff-beda-6afc00bcb681","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.896639Z"},"links":{"cited_paper":"/paper/2203.08120","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:c49721b065e90ff31e052870ebfde897365039aa3d685948a8e4b783c6cff9f1","observation_id":"f6072648-2491-47d1-9f03-c2373e9c0d1c","resolution":{"observed_at":"2026-08-07T11:57:23.011772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01626","last_updated":"2016-04-04T02:34:30Z","snapshot_observed_at":"2026-08-07T08:03:58.370822Z","submitted_at":"2015-09-04T22:31:53Z","title":"Character-level Convolutional Networks for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01626","snapshot_observed_at":"2026-08-07T11:57:22.901611Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.901611Z"},"links":{"cited_paper":"/paper/1509.01626","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:9ad92848889187d3d861aa3d4e3401d7077a71f2e278fba48e8ee1e1c10d5d33","observation_id":"294b2fae-c881-45c7-a025-2371793ba2e9","resolution":{"observed_at":"2026-08-07T11:57:22.901611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.735863Z","title":"Algorithmic capabilities of random transformers","venue":null,"work_id":"5b1026c7-efa6-4abc-b7e0-5d772672d91b","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.908318Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:a59ee593e9bf56c1163e71652b17eb3e19e6a213cec1d34bb773af168fcb8101","observation_id":"8b1f9f34-206f-4e51-ae70-d8265d664326","resolution":{"observed_at":"2026-08-07T11:57:23.740198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:48:16.522772Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 11 inbound Pith citation observations for arXiv:2506.01115."}