{"as_of":"2026-08-13T15:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5bc4ff3ccdc4ba82e7f75037f8d2c53c7cc9e48fa39f3deae3f1e28dbef05c5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:12:48.259338Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:17:09.834609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:05:58.230449Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"cited_work":{"arxiv_id":"2506.12220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two heads are better than one: simulating large transformers with small ones","venue":null,"work_id":"20dd94c9-701c-42fe-ba76-8894c62c20e2","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2506.12220","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:71833441d2d33927922adb341c7bf2d68c2f2a45926801da479059a58abd2696","observation_id":"795242bf-3d0f-49a8-96ad-9f827583f903","resolution":{"observed_at":"2026-05-11T09:05:58.232597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12220/citation-record","integrity":"/paper/2506.12220/integrity","json":"/paper/2506.12220/citation-record.json","paper":"/paper/2506.12220"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.891226Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"0355d266-befe-4517-9dc0-a0843a5f770c","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.079998Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:e0697172000f64e4a141979b9024727a67e18d0c6ada20fc2dc75bb7d4cc7492","observation_id":"6b51397b-9819-4a56-bba0-0277ff4eb8cd","resolution":{"observed_at":"2026-08-07T01:12:48.896786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.875764Z","title":"Fast attention requires bounded entries","venue":null,"work_id":"5f12b229-21d9-45b7-a13f-a3ed69cc525b","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.085462Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:b4303c5aca76f3bb19634928c3e120d5238dea7300f76042e54ad6da70da44c0","observation_id":"af1324c6-0fab-4832-a706-76dc132db978","resolution":{"observed_at":"2026-08-07T01:12:48.880702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.860964Z","title":"Fundamental limitations on subquadratic alternatives to transformers","venue":null,"work_id":"9d7fa699-a558-473c-9a0f-c4a2989b1605","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.090223Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:608ee0417959bb3b4405e0c53ca72998eb51e35292f9de94ce923d2ff25d9ede","observation_id":"8a8047c2-678c-45a3-a1ac-422c5871ea0f","resolution":{"observed_at":"2026-08-07T01:12:48.865671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.845671Z","title":"On the A bility and L imitations of T ransformers to R ecognize F ormal L anguages","venue":null,"work_id":"83ae1510-8c60-49a2-9288-f35033c35928","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.095765Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a10aa4162cd410f9389ff63ae787d6faaf1b7e05fbee9f4b5b1ddc6f3180e049","observation_id":"7945a37a-e689-418e-b8c0-acba451ad33f","resolution":{"observed_at":"2026-08-07T01:12:48.850871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.829481Z","title":"Separations in the representational capabilities of transformers and recurrent architectures","venue":null,"work_id":"227a68b8-3112-4c38-965c-369e5430458f","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.100144Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:fda4262e423a303794c6253b59ac1f358c3f73f7cf7097eb6fc3a2de91f0a4b4","observation_id":"fa65ef42-f46d-40c2-93c3-37b94a062016","resolution":{"observed_at":"2026-08-07T01:12:48.835057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T01:12:48.104615Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.104615Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a98fd9ffcd17cc49c46851fd6bbabfbdd9397735cd835dbbe0c7156498f88ea6","observation_id":"024fca3b-7758-4ed9-9ec7-c685edee9285","resolution":{"observed_at":"2026-08-07T01:12:48.104615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.814067Z","title":"An exploration of hierarchical attention transformers for efficient long document classification, 2022","venue":null,"work_id":"1e4713d2-9854-4a7b-81a5-abac08245758","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.110449Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:8995ab50ebf2ffb078f567dc811673823b2fd5256adf467d994a0422c7ea0157","observation_id":"addbc6b7-327f-4df2-a6d5-7a5383a7a3a4","resolution":{"observed_at":"2026-08-07T01:12:48.819050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.114975Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.114975Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:da250ee2dc0081bf74ef2cb3c3dc80ab12a891de404992d725f62ed376db53ca","observation_id":"d63ca6e3-07d2-4db9-ada5-861a5bfe1370","resolution":{"observed_at":"2026-08-07T01:12:48.114975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.789513Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"f210bc37-0572-4161-97b0-9e06f411b87a","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.119593Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:23b691202c8782cd1b78298118436daf560d7e91d7b2c047dfd435ddba452ddc","observation_id":"208bc6d9-2b45-4ef8-adae-3785c449204f","resolution":{"observed_at":"2026-08-07T01:12:48.794430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T01:12:48.123953Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.123953Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:e23eae448d8e8ee4a067ee0b09b1cf3399386d63672ea429e7528983839397b3","observation_id":"c0d9153c-e51b-4936-abef-f0a471cc6c8c","resolution":{"observed_at":"2026-08-07T01:12:48.123953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.774974Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R\\' e","venue":null,"work_id":"20078798-4029-4ddb-9647-fa6b54023c8a","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.128702Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:734ba690b81423bb4cc76fc2ad4e5cba358283f090e42bfaa422a5d9ad8f189e","observation_id":"74419346-96a3-4ec1-940e-a64dd8201936","resolution":{"observed_at":"2026-08-07T01:12:48.779890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.759820Z","title":"Etched is Making the Biggest Bet in AI","venue":null,"work_id":"c2c5b585-3fcb-43be-95ca-dde748344613","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.133124Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:9e5a95e945c2c97c685f43e09202e0229c515c89e658a33eb0877a7609d5f18d","observation_id":"02e50453-d976-4a8e-a032-008066dfdcaf","resolution":{"observed_at":"2026-08-07T01:12:48.765080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T01:12:48.138043Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.138043Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:01369f8d986fc5146a0d6a924f58d3eca79399a00ef292cbe6d1cdcdf0a3c82c","observation_id":"f4cb5a0f-b75d-436c-996d-6573336e49c3","resolution":{"observed_at":"2026-08-07T01:12:48.138043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.744093Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":"aebb2789-e602-48b1-ba51-4638ce1d7956","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.143413Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:c4b9bf14ab1d2b8878cfe6921b6b09684c3dc7428229ff22f3a2e2dda0081058","observation_id":"a02b2ac7-3259-4954-8b3e-8da43426ddb9","resolution":{"observed_at":"2026-08-07T01:12:48.748865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.728833Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":"b860268d-3d9b-44ad-b98b-8572c19a68a7","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.148089Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:6f0ed6910f6436b6213edafb560a4bd55f3c817ec98f1482a888b01715a32f70","observation_id":"38ea6915-586e-4ae5-941a-ada67e86cc74","resolution":{"observed_at":"2026-08-07T01:12:48.734346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.713406Z","title":"Computational limits of low-rank adaptation (lo RA ) fine-tuning for transformer models","venue":null,"work_id":"b39e8f50-e086-464f-94cb-06b8bb30b4eb","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.152253Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:15f25cd424dfacb2735b57a78021ede2234e917d4a6f113f8c9ca33e16fda04d","observation_id":"08d07ec7-a333-4c40-8c90-2aa45499d470","resolution":{"observed_at":"2026-08-07T01:12:48.719060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.699076Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":"e3129103-9c33-4409-a6ab-9f24cf21c564","year":1989},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.156366Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:5b831d1f6447264e49a52337738c0fc5a767200da133951c093ef8ce966f174f","observation_id":"fe1866d1-3cbd-4e71-9b22-14369cd71c7c","resolution":{"observed_at":"2026-08-07T01:12:48.703811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.684154Z","title":"On statistical rates and provably efficient criteria of latent diffusion transformers (dits)","venue":null,"work_id":"5e693ec4-57ac-45a6-98bd-3634e1d85078","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.160515Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:be07f27dcee37f3d4bea17f2847cdcaa8f810de3c5ceaaa2188531df76293bdd","observation_id":"38e00788-d632-489c-995f-418982c0cfe1","resolution":{"observed_at":"2026-08-07T01:12:48.689004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.165303Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.165303Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:724ff403461d4b244579067a071838309cba1692df2c39007ef30734159699e8","observation_id":"7cdac334-4f01-435b-8d57-51f8908b4925","resolution":{"observed_at":"2026-08-07T01:12:48.165303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.659256Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"5ab3b3b8-bd27-44a6-b3be-67fa446f78a6","year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.170867Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:4a810b7404ce03a49882a2c3bba377af77790e1fecfa9123c7e16d688c379789","observation_id":"acebf52c-beb3-4a63-ab6c-4ac01dd9cf27","resolution":{"observed_at":"2026-08-07T01:12:48.663817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.645435Z","title":"RNGD preview: The world's most efficient AI chip for LLM inference","venue":null,"work_id":"1b1cf127-5545-4d11-8e1f-0455cd8d1326","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.175070Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:f883255159f3fd3c5af3314146d43a8aada9f4c8f6488335ccd042fdf18e44f9","observation_id":"e9d094b8-0055-414d-9fb4-a96198d7feb0","resolution":{"observed_at":"2026-08-07T01:12:48.650041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.631447Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"c50f634d-ed21-429f-a443-483a10e1ed1d","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.178891Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:ae1fb45eb3807fdfdbf41c752ebade5a3b6efd620fe069206e8191d597bb0410","observation_id":"d80f281d-47c8-4a70-a344-5a40cd0df65d","resolution":{"observed_at":"2026-08-07T01:12:48.635829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.617570Z","title":"Polysketchformer: fast transformers via sketching polynomial kernels","venue":null,"work_id":"4fe8a121-8dd4-485b-a865-4b79e8f8dd98","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.182787Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:1080bfecf13fd2c027389baca4b477462ca09efb0d7edbcb758c0cd19f0328e2","observation_id":"278afdd6-e958-4ee1-906d-af3f472e816a","resolution":{"observed_at":"2026-08-07T01:12:48.622136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.603074Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":"52c9456f-6fe1-498d-b6a7-e62493e0cdf2","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.186811Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:85358c9ba24923c3d2415ca61a2b3050d960772b492a06aaf7bc93295c943504","observation_id":"48ed1d42-b864-410a-bf0b-22644b5e50be","resolution":{"observed_at":"2026-08-07T01:12:48.608236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.588354Z","title":"On the expressive flexibility of self-attention matrices","venue":null,"work_id":"15396cbb-9f87-4359-a970-bc74ab6080c0","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.190765Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a667cf6450cdf3596895519ef359deaa8d475ee0932fe1a06b5303edc1fd3807","observation_id":"ed2960ec-a1f8-4d69-88f3-f2648a08b744","resolution":{"observed_at":"2026-08-07T01:12:48.593022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.574554Z","title":"Hierarchical transformers for multi-document summarization","venue":null,"work_id":"e7f0d630-b50e-4af8-8634-883bcd67efab","year":2019},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.194683Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:df28f079064076df35be57dc384ac8ec1d50394d5bf0d803baafc4c350d7d0c5","observation_id":"c29f4383-d564-47e4-b9a4-2b207dacee37","resolution":{"observed_at":"2026-08-07T01:12:48.578990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.559832Z","title":"The parallelism tradeoff: Limitations of log-precision transformers","venue":null,"work_id":"04b23362-584b-40b7-b002-0551dbfe1319","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.198545Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:8f91335a8a43dff37f1376c8ed267978ed5941d93dc9fa994caecf3154923093","observation_id":"d90d4e61-9a47-4870-896a-c408cef07b8b","resolution":{"observed_at":"2026-08-07T01:12:48.564989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.545482Z","title":null,"venue":null,"work_id":"46079d82-fec8-44fa-834b-78046245311a","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.202818Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:58d95da7e0d3e0b3893d187f767417d5e83f86c169f0671f752bcb3ddacd852d","observation_id":"fc1f91c6-6d9a-44ea-9d52-57cf35de5df0","resolution":{"observed_at":"2026-08-07T01:12:48.550241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.531421Z","title":"Language models are few-shot learners","venue":null,"work_id":"e06a64df-1ad7-4029-a9ef-c89027d26df1","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.206861Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:25f056ee412a849182d1f2f8b6629a9f129583853b9827996b7c78db01d0f406","observation_id":"3bb1e02f-d1fa-4f28-9bbd-3aa12a639221","resolution":{"observed_at":"2026-08-07T01:12:48.535978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.517171Z","title":"Hierarchical transformers for long document classification","venue":null,"work_id":"d14a15ce-3036-453f-b79a-32e966e77036","year":2019},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.210920Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:c4581d8105fe37a1151beadcef610607d1aa2c4004023cacd559417557d62b63","observation_id":"3b258ad8-d2ad-446f-badb-12896773279a","resolution":{"observed_at":"2026-08-07T01:12:48.521713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.503153Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":"e25e6342-02f4-4c4d-875a-5962795fcda2","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.214838Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:1a85aa0871daea81d7274386af23955007aac5a5461c5f812d11c6d8fa2ccd6b","observation_id":"b661e8a2-a0a8-4843-add4-4105573376c4","resolution":{"observed_at":"2026-08-07T01:12:48.507820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.487968Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":"1d736ea7-0bdd-4433-997d-f3f7bdd8e83b","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.218877Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:2b7f57305d24426585fa675ebfda3220d2914df6dba2fcbb30951314d23e0eaa","observation_id":"3ef4a2f6-b742-4a37-a5c6-ff8c5eba978d","resolution":{"observed_at":"2026-08-07T01:12:48.493360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.472649Z","title":"What formal languages can transformers express? a survey","venue":null,"work_id":"36338ccf-097a-45b6-8d24-35bdc5695707","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.223004Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:2702a090c9197b0d8adbba5535a2384a947aa7c2fdb56e08ababce56bddbc2a2","observation_id":"44e1558a-3115-4c57-9557-a69b1b43a757","resolution":{"observed_at":"2026-08-07T01:12:48.477544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.457683Z","title":"Efficient transformers: A survey","venue":null,"work_id":"870c1c6e-1f63-4dfe-931d-3ee9b8fe7788","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.227406Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:e0ae4f0bd49756cceb0ea0f8fe4111178c95f8d26e94730af9ceb40da2856c64","observation_id":"c1d55e78-58a6-4b59-9ea1-a56d3a76e0b8","resolution":{"observed_at":"2026-08-07T01:12:48.462466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.441408Z","title":"Schmidt, and Stephan Peitz","venue":null,"work_id":"6dbe6def-eda4-483d-9106-f0338c9d13a8","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.231424Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:7ec155c874b97a56c61e17ccdea222c794af600ed258d260d20c75efb354faf0","observation_id":"9445936f-2977-44c6-af2d-d60cdfd6cd04","resolution":{"observed_at":"2026-08-07T01:12:48.446971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.424791Z","title":"Gomez, ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"0e2b93c6-c076-46ee-bd68-59f3636ad200","year":2017},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.235774Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:f090d60dcd369c67a12ee968a1fb569abf409920bed9819010d0a047d5d5e95c","observation_id":"b3536e4d-94ec-4bcd-bfec-8e67154f4f8e","resolution":{"observed_at":"2026-08-07T01:12:48.429843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.409310Z","title":"RNN s are not transformers (yet): The key bottleneck on in-context retrieval","venue":null,"work_id":"3f641cd1-a519-426b-941b-3dfd9a793006","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.240370Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:995cc6f96b48656535a50aef9b955151566f30d86d9d23c4db0e642127d167d0","observation_id":"80d2ebdf-30d9-43e7-b2e9-9935b9e57e94","resolution":{"observed_at":"2026-08-07T01:12:48.414278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05722","last_updated":"2022-06-16T11:29:37Z","snapshot_observed_at":"2026-08-06T19:12:17.119444Z","submitted_at":"2021-10-12T03:17:03Z","title":"LightSeq2: Accelerated Training for Transformer-based Models on GPUs","version":3},"cited_work":{"arxiv_id":"2110.05722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.05722","snapshot_observed_at":"2026-08-07T01:12:48.296214Z","title":"LightSeq2: Accelerated Training for Transformer-based Models on GPUs","venue":"cs.CL","work_id":"c6023a77-e9cd-4822-8baa-bbb0fd71705c","year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.245834Z"},"links":{"cited_paper":"/paper/2110.05722","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:23275546fab74d42c0e162d0f80eafdcd6e189be1555b35e1556e2733ba82762","observation_id":"de93e740-306e-4720-b64c-b46d5a14bddd","resolution":{"observed_at":"2026-08-07T01:12:48.303846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.393451Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"7441ae13-6f85-40e7-a48b-30168eba4e07","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.251148Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:fc8b956ab860f852825d9dedf8e9f162088556dea86c2dddc95d1fa118722f95","observation_id":"7d215dfb-3d60-43fe-8962-399d38217616","resolution":{"observed_at":"2026-08-07T01:12:48.398365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.377687Z","title":"Are transformers universal approximators of sequence-to-sequence functions? In International Conference on Learning Representations , 2020","venue":null,"work_id":"61ffec2c-f6e4-4d88-aff8-eaae9fc58df3","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.255183Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a6e473be874b923ccf3ae77c4d8cffc02a228dabc48e2818acfe8e61e87393bd","observation_id":"12d921ac-cc04-4481-b458-297b95299f53","resolution":{"observed_at":"2026-08-07T01:12:48.382813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.361444Z","title":"Reddi, and Sanjiv Kumar","venue":null,"work_id":"8ddae1ea-c08a-4d36-b58f-1458c1d4e20c","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.259338Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a9228abc3794fd2861b6a74949617fab713fc88b09e382593e959b31cfbb187d","observation_id":"c1d80b37-089f-44c1-868f-5cd1ac530dc0","resolution":{"observed_at":"2026-08-07T01:12:48.366538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:53:09.146173Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.12220."}