{"as_of":"2026-08-08T18:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35814599acc211c32faa8638a5198a06f04e5d1859801e459704f9b18c1ae210","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:13.305354Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20802/citation-record","integrity":"/paper/2505.20802/integrity","json":"/paper/2505.20802/citation-record.json","paper":"/paper/2505.20802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.234630Z","title":"A deep conditioning treatment of neural networks","venue":null,"work_id":"d983e446-a7fd-4fa5-af4d-d6644320f476","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.034328Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1d312335d50dae9d0730cbccedd4cb3d224e49e3bba911770818ebaa62f65c99","observation_id":"aa05ce8e-8208-4cdb-91a9-9f0d85dfee56","resolution":{"observed_at":"2026-08-07T13:53:19.425180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.941376Z","title":"Xcit: Cross-covariance image transformers","venue":null,"work_id":"1ca0987e-75eb-4d3e-a3a1-61e82b9abafb","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.162406Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:5648491798243a03a4cbd8e5ef23a1344441ac2a34421abbb35d64f39d69fa1e","observation_id":"01750a21-676d-4050-b7cd-1a2ce70de4ec","resolution":{"observed_at":"2026-08-07T13:53:19.156179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.810801Z","title":"On the op- timization of deep networks: Implicit acceleration by over- parameterization","venue":null,"work_id":"5c38f693-c0db-48e3-aa97-4e03860fc9f4","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.316954Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7752c2b4a0f7c92ae8687cc87cdc883ba9dd353d88f1ae6ec5d7ff7d8f31cb8c","observation_id":"622a335c-181c-42a2-be4b-66791f259c5f","resolution":{"observed_at":"2026-08-07T13:53:18.867260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:09.459325Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.459325Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:561d0332b05295a27924b68eb916733621ec6bccad238dda7f71b6838609bcb9","observation_id":"3d4441ca-1002-4665-9104-6606be01699b","resolution":{"observed_at":"2026-08-07T13:53:09.459325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.615808Z","title":"Rethinking attention with performers","venue":null,"work_id":"2ba90e82-c9bd-4ab2-ad4b-dcfd8f05cf20","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.561350Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:8fc55e25a2bdfa5347497a3dddaa2701ad43c96831418f96a6c5e1d4e55f912e","observation_id":"832261df-1c02-4e3d-9e0e-6dc5476c78b7","resolution":{"observed_at":"2026-08-07T13:53:18.721286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T13:53:09.658901Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.658901Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:38e97959d056a04512860da12b88e3cd10b004fecf1defdd92b68e9f1b752658","observation_id":"a1419588-3169-40f8-ad3a-796f240d693b","resolution":{"observed_at":"2026-08-07T13:53:09.658901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.445447Z","title":"Davit: Dual attention vision transform- ers","venue":null,"work_id":"0923d357-0455-4ea2-9658-a5368d1e31aa","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.807743Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:efc642f628d2d50bce7bd25cbfb24d67990d113205e0ec775822f348b11caec0","observation_id":"980b9ea1-4735-4fe4-986c-45f30d8d05f2","resolution":{"observed_at":"2026-08-07T13:53:18.551570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:53:09.946194Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.946194Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1b603a3d5aaaf97866c53b5a62b48c8ab968737032b7a1902cd420228592033d","observation_id":"93c57150-92b7-43bf-bdaf-4e2adab4804a","resolution":{"observed_at":"2026-08-07T13:53:09.946194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-07T13:53:10.115483Z","title":"Tinystories: How small can language models be and still speak coherent english? arXiv preprint arXiv:2305.07759, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.115483Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:03efe9cdea4aaa06e105d166c3d446c436ca01949b2051a74e099f2969dd6a52","observation_id":"ef95e9bf-f52e-4ea4-ad23-0d8c634941a0","resolution":{"observed_at":"2026-08-07T13:53:10.115483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.250236Z","title":"Drive like a human: Rethinking au- tonomous driving with large language models","venue":null,"work_id":"2c899247-01a7-442c-a84d-a1c8660166e6","year":2024},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.232092Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:03d7af3711960777ca2f9b3511bf706ad698da8a62d80089b6dc4888d15d7ed0","observation_id":"c2f8fbce-d0ed-46bb-ae0b-cc288c2dc65a","resolution":{"observed_at":"2026-08-07T13:53:18.332722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:53:10.351485Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.351485Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1b97c3481f5bfae8afc65e382234ae5308fc985f81407bcc3db634900b137f5e","observation_id":"4076683d-2bb3-46c1-844a-813c4778f542","resolution":{"observed_at":"2026-08-07T13:53:10.351485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.112368Z","title":"Cramming","venue":null,"work_id":"f280df47-c519-4786-ae03-a0f5ba55f09c","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.468447Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:2ba4f5418220b88a94028898f4cbdae8338975f302ec1806ef10fb6376c377a7","observation_id":"94949c45-019d-4f6a-8097-fccfe740ac80","resolution":{"observed_at":"2026-08-07T13:53:18.181276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.898555Z","title":"Cramming: Training a language model on a single gpu in one day","venue":null,"work_id":"47e389e4-b94d-4588-b6ce-fd8d0e435e87","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.536029Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:f9b8085c32141f0d0af553abec78b32895877a6d3c12f077ae6f3fcba40aab30","observation_id":"8122e36f-47df-4a41-b51d-88980b3c09d1","resolution":{"observed_at":"2026-08-07T13:53:18.003646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:10.628588Z","title":"Transformer in transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.628588Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:0783b0e00b105b9698b7ab86d0fd65f6cf9409cd0c35361e455d185ff33ba7d6","observation_id":"d44dec49-3d12-4736-8a91-3f0a003c6f62","resolution":{"observed_at":"2026-08-07T13:53:10.628588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.599863Z","title":"Neu- ral tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"c73a90c6-ebff-45f7-8192-2b6f71ac9527","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.710054Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:920dace61a17896d9907a0bc693c9015641a32e82bdf7a053736a7c80fa95ede","observation_id":"a817ca96-d9b8-4b60-b04e-993a1772915f","resolution":{"observed_at":"2026-08-07T13:53:17.755706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.474516Z","title":"On the size of convolutional neural networks and generalization per- formance","venue":null,"work_id":"dc98d1d5-bc2d-4fb0-8c2c-4f3850a5241b","year":2016},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.798388Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:917b23e96ec978e227f45dd0ad6f40744c8bd24e5b7c2c0ce381a731a4f89ee8","observation_id":"d4433458-c758-451a-b672-a7cd124caa67","resolution":{"observed_at":"2026-08-07T13:53:17.540790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.244596Z","title":"Re- former: The efficient transformer","venue":null,"work_id":"5840b252-a36a-4d73-9777-a436c50f914f","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.880408Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:91f138339941dfc96178efde514ed77869a97f1a43c8fca04ca4d7d3574bbc13","observation_id":"28f6b77f-0022-4929-9d0e-ccb0d27f4a67","resolution":{"observed_at":"2026-08-07T13:53:17.374388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12467","last_updated":"2021-01-17T18:17:31Z","snapshot_observed_at":"2026-07-06T09:31:35.184904Z","submitted_at":"2020-06-22T17:47:09Z","title":"The Depth-to-Width Interplay in Self-Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12467","snapshot_observed_at":"2026-08-07T13:53:10.980819Z","title":"The depth-to-width interplay in self-attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.980819Z"},"links":{"cited_paper":"/paper/2006.12467","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3de15e0a0df777e2bcd8e75cd91753fb8e9b9a5fbbd72a59a080da09e10d4a98","observation_id":"8c440c53-4fd6-4377-88bc-30bded8e3cc9","resolution":{"observed_at":"2026-08-07T13:53:10.980819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.075755Z","title":"Limits to depth efficiencies of self-attention","venue":null,"work_id":"fabc809f-5788-4280-bfbf-5cde0264328b","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.067802Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:b699d7c8f4ad9916a879d8cc4c17f33116dc917ebbf0eefe32ff097c55a674bb","observation_id":"a4656912-f2d7-4c95-9724-11c96f5988fe","resolution":{"observed_at":"2026-08-07T13:53:17.164882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05159","last_updated":"2019-07-03T18:24:09Z","snapshot_observed_at":"2026-08-03T08:09:11.958015Z","submitted_at":"2018-06-13T17:35:55Z","title":"On Tighter Generalization Bound for Deep Neural Networks: CNNs, ResNets, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05159","snapshot_observed_at":"2026-08-07T13:53:11.154002Z","title":"On tighter generalization bound for deep neu- ral networks: Cnns, resnets, and beyond","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.154002Z"},"links":{"cited_paper":"/paper/1806.05159","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:df29f8644c9da9641a3c4c75cc0a956cbbc8a86756a5992a63f24dd1ac83d26d","observation_id":"8bcb3d35-6155-4a67-adfa-a7f17636c20f","resolution":{"observed_at":"2026-08-07T13:53:11.154002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.786416Z","title":"Loss land- scapes and optimization in over-parameterized non-linear systems and neural networks","venue":null,"work_id":"5ecb9e66-6770-43c2-8435-ec7977616196","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.267568Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:b854bcc861925f33921d7405b1b479829a3f9a600bb26bf7a1db3f6c30541579","observation_id":"424b5107-c515-41ca-ab89-a6e7104cf9e4","resolution":{"observed_at":"2026-08-07T13:53:16.915596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:11.348724Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.348724Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1abc8faec93d30dcca04682b980efb5a0c380d0903556bbf3244a627ab74d2ff","observation_id":"4b3b603c-76cd-40f3-89ff-27477b4cdb5b","resolution":{"observed_at":"2026-08-07T13:53:11.348724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.646067Z","title":"The expressive power of neural networks: A view from the width","venue":null,"work_id":"dc480205-3666-402a-8ef3-dc43cdea7fbc","year":2017},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.438467Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:e7b3b911ee857fb18a460915ccefa61d50b41c102684324c29cd5e68803a3206","observation_id":"ed0b4e89-b93e-4d38-b190-339e79bcc449","resolution":{"observed_at":"2026-08-07T13:53:16.716353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.491549Z","title":"Transfusion: Multi-modal fusion network for semantic segmentation","venue":null,"work_id":"773d65a5-754f-4597-b08b-87a82b70f209","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.544733Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3669ba239a582aa2843382b15b089db3d25344dbeae30cec25f1abb4ff57045f","observation_id":"721e7453-42f3-4eeb-9e84-7b01e24dea3b","resolution":{"observed_at":"2026-08-07T13:53:16.571609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.361037Z","title":"Numerical optimiza- tion","venue":null,"work_id":"1da95a27-df14-4686-8e79-64468ea172ae","year":1999},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.625386Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:57b8d9147cf162406ee052465b05211239fc73a0c9f874023086f5f8bbfd531c","observation_id":"8bf7a85e-954d-44b9-934e-6add32e88502","resolution":{"observed_at":"2026-08-07T13:53:16.426135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.188455Z","title":"The impact of depth and width on transformer language model generalization","venue":null,"work_id":"50652a9a-f775-4461-bbf7-15ba1d875c08","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.758211Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:d473d7dfbbbe4df58df2dfb0644ac944fd34621ad09a452003014d6c95acfb68","observation_id":"afafbf8c-2619-4c9a-be87-d9271319f90d","resolution":{"observed_at":"2026-08-07T13:53:16.267841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.031784Z","title":"Exponential expressivity in deep neural networks through transient chaos","venue":null,"work_id":"04dedb0a-053c-4df9-adda-ed900aa2f3be","year":2016},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.859104Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:aa23c69c87f96396638998b1af65d8e37ed7d226dd4c5dae620443380f6be619","observation_id":"fc66014d-698a-487f-b293-a4faf56edf7e","resolution":{"observed_at":"2026-08-07T13:53:16.130245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.844592Z","title":"Tiny-stories-gpt","venue":null,"work_id":"d5d3d360-7f58-4a1b-bc65-07b50d237a19","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.950438Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:c14d93d3ad7c59c0415e3941ee286f7365b33b65aacb053392d0d767dd6796a7","observation_id":"adb98fdc-43f3-4d81-bbe6-48334022aafa","resolution":{"observed_at":"2026-08-07T13:53:15.929889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03093","last_updated":"2021-01-13T18:53:02Z","snapshot_observed_at":"2026-08-01T21:17:51.631420Z","submitted_at":"2020-01-09T16:47:17Z","title":"Trajectron++: Dynamically-Feasible Trajectory Forecasting With Heterogeneous Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.03093","snapshot_observed_at":"2026-08-07T13:53:12.040288Z","title":"Trajectron++: Multi-agent generative trajec- 10 tory forecasting with heterogeneous data for control","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.040288Z"},"links":{"cited_paper":"/paper/2001.03093","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:a7659b0c23180db49a61111d95e39c16d54822cbd4d022452a83e9e5b4632f03","observation_id":"4e46a6c6-03c5-4f7f-a075-8794bc32805f","resolution":{"observed_at":"2026-08-07T13:53:12.040288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.710639Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":"4a10ebfd-f9a4-47f9-a2c8-f63ade47ba4d","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.116907Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:9b1b71d378a7797361bdbbcebbf9fc902650596166cb3435b6823a205a7faa08","observation_id":"43510b91-c664-4914-85d7-8c226607df28","resolution":{"observed_at":"2026-08-07T13:53:15.767405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.537025Z","title":"Real analysis: measure theory, integration, and Hilbert spaces","venue":null,"work_id":"938b7a30-340d-4a0e-b231-59878ba8e92c","year":2009},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.186595Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:55d380fbf37bee1fc5bb63f944c4678db388d1da1336bb5abc123cb28b84110a","observation_id":"1985930e-d536-4375-a2b6-5680575faf4e","resolution":{"observed_at":"2026-08-07T13:53:15.626931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10270","last_updated":"2022-06-23T10:51:04Z","snapshot_observed_at":"2026-08-06T08:18:31.112514Z","submitted_at":"2021-06-18T17:58:20Z","title":"How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10270","snapshot_observed_at":"2026-08-07T13:53:12.281412Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.281412Z"},"links":{"cited_paper":"/paper/2106.10270","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:36e4f02c0b80d569534e20ed4f673d439be9f824d2c1a0e84523eee32f932555","observation_id":"764911ee-d831-4bb5-84c0-49aa58cfe182","resolution":{"observed_at":"2026-08-07T13:53:12.281412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-07-06T10:12:38.348940Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-07T13:53:12.361815Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.361815Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7afe4024ef60d5390cbfe8a7eeadcdb5f53e9ffbc398ca54d48e4956f36e72ca","observation_id":"31d27f5e-ddd2-4935-8e67-82d97cfd151a","resolution":{"observed_at":"2026-08-07T13:53:12.361815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.255047Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"cd8e3f66-19e5-41c5-8f83-9ef3b3f23fe5","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.442508Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:6026c9345309d63caf7e2f5e317cd16429a41d1181d9b98a509926acf6a01013","observation_id":"36dc04fe-54e3-4747-b9aa-194264362edc","resolution":{"observed_at":"2026-08-07T13:53:15.394585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.045559Z","title":"Width is less important than depth in relu neural networks","venue":null,"work_id":"76014207-14af-4a54-9cb5-ef34deec3b7e","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.535662Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:ed0e4c8c847a5e251cc6ed0f1d05e5577ee740d7786f7035c001161a3480538d","observation_id":"5849d952-ba2b-4f5b-be49-8e315ee16638","resolution":{"observed_at":"2026-08-07T13:53:15.177550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.792122Z","title":"Attention is all you need","venue":null,"work_id":"fc2039df-2ab6-406b-9f95-93af380515b3","year":2017},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.619327Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:eff12cb0db11fafa55a81c54e5f4fdbea02384c01b107b77a71c1fde252768b2","observation_id":"4244fd36-db2f-401f-9ad1-5a334b7590c3","resolution":{"observed_at":"2026-08-07T13:53:14.854796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.611369Z","title":"High-dimensional probability: An intro- duction with applications in data science","venue":null,"work_id":"be376f72-c2ac-456b-9d21-6409e614538a","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.713775Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:b6103baf511b884b16c4fe1f966ca2277a066c244e00c3f56adf7400ae841e2d","observation_id":"80c06c48-fc80-4a8e-8931-33c6daf085a9","resolution":{"observed_at":"2026-08-07T13:53:14.720110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T13:53:12.781563Z","title":"Glue: A multi-task benchmark and analysis platform for natural language un- derstanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.781563Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7c85f53d52c9cc977959622d0f45a842a0aa23ba821ca2faccf6e3f162020f1c","observation_id":"27206a34-a8a9-450f-aa85-cd59e28c352d","resolution":{"observed_at":"2026-08-07T13:53:12.781563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.434946Z","title":"Linformer: Self-attention with linear complex- ity","venue":null,"work_id":"ef51a5c1-adce-4673-bd6f-25dae18d94b9","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.836097Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1aefbef7b5708309b38edc64fd9c5922604ed132383f20cb60822d4df8f61826","observation_id":"1b162034-64cc-4bd9-bcea-25ad16772ef1","resolution":{"observed_at":"2026-08-07T13:53:14.514716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.243349Z","title":"Github repository, 2021","venue":null,"work_id":"f9d1fe96-5d18-4138-9e1a-f39cc8c30312","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.907534Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:11cb22678bf43be67729e0b72ae606510d232fa334d238b1daa0baa4418fa950","observation_id":"d50ddb4e-77f8-4be6-9e21-843ccd74a516","resolution":{"observed_at":"2026-08-07T13:53:14.325590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.091400Z","title":"Nystr¨omformer: A nystr¨om-based algorithm for approximat- ing self-attention","venue":null,"work_id":"3ef4c218-8733-452c-9e28-e8e3e1025fef","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.982547Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:d581bc54c4bdb7eb9b82834a85bac10f857e761663dc241dcfd30e35fa45c032","observation_id":"80d8fcc6-bb68-4c83-986a-3ff2466558af","resolution":{"observed_at":"2026-08-07T13:53:14.156866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.937034Z","title":"V olo: Vision outlooker for visual recog- nition","venue":null,"work_id":"2641cb60-cb49-44e0-b176-19fd535f47b8","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.044588Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:e89bf0273375a041a606127f86b10f1b14065e2c5c445305062532bf164bc0b0","observation_id":"622798dd-8cab-497c-95d4-262d39936b60","resolution":{"observed_at":"2026-08-07T13:53:14.014039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.771630Z","title":"cosformer: rethinking softmax in attention","venue":null,"work_id":"7819dc6b-1b44-4242-9bb8-0c12cd704e93","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.118002Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:a7bdc541b849f31821c3ac35eab926191ba514c7bde3c691c647fc9056fed0fc","observation_id":"73f1affc-3c99-4491-a8f3-2d1395b2a604","resolution":{"observed_at":"2026-08-07T13:53:13.848094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.608260Z","title":"Understanding generalization and optimization performance of deep cnns","venue":null,"work_id":"0e22456a-9596-41e0-8989-537d1a136507","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.197390Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:66ae106c1c62f0f2840297cd951365e39ff07850a80e7127dcc8e17311e1c910","observation_id":"2d421d34-2722-4ebe-b59a-3ee49888125a","resolution":{"observed_at":"2026-08-07T13:53:13.683260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.474085Z","title":"A robustly optimized bert pre-training approach with post-training","venue":null,"work_id":"34bb4927-4958-4676-b20b-52aa13cb3f46","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.305354Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:ddcc9dca7ce9346fb1f58197529b63c858d80efb85642cde1aaf656974390d97","observation_id":"edd4c23a-d92b-4435-82b4-51a4a181152e","resolution":{"observed_at":"2026-08-07T13:53:13.523878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:44:37.360144Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.20802."}