{"as_of":"2026-08-09T03:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aab790148066b078d000e70bf7de45ffde6e9f2a0571aa913d83f8601cdba707","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:19:19.455902Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09245/citation-record","integrity":"/paper/2502.09245/integrity","json":"/paper/2502.09245/citation-record.json","paper":"/paper/2502.09245"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.958071Z","title":"Transformer math 101","venue":null,"work_id":"11f42860-c093-444e-a343-f3ea897fb582","year":2023},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.323328Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:fa3b9d87a10035abbf02decca10136c801113979cb961446efbb2e43052195b0","observation_id":"2061c500-51aa-4dd9-9ab5-ed7ac74b1772","resolution":{"observed_at":"2026-08-07T22:19:19.962767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02344","last_updated":"2025-03-20T17:37:44Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T18:14:07Z","title":"Seq-VCR: Preventing Collapse in Intermediate Transformer Representations for Enhanced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02344","snapshot_observed_at":"2026-08-07T22:19:19.329231Z","title":"Seq-vcr: Preventing collapse in intermediate transformer representations for enhanced reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.329231Z"},"links":{"cited_paper":"/paper/2411.02344","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:d8d01f0799031a002ebd93c878c6c1067c7586c57c85c546a7dcefc23fb299a1","observation_id":"81d8eaf0-dc23-4ec8-aed1-48e9f08d6cb9","resolution":{"observed_at":"2026-08-07T22:19:19.329231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07561","last_updated":"2018-09-04T20:10:24Z","snapshot_observed_at":"2026-07-06T06:56:57.127117Z","submitted_at":"2018-08-22T20:53:37Z","title":"Training Deeper Neural Machine Translation Models with Transparent Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07561","snapshot_observed_at":"2026-08-07T22:19:19.335520Z","title":"Training deeper neural machine translation models with transparent attention","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.335520Z"},"links":{"cited_paper":"/paper/1808.07561","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:3f1d4fa30a4896b26b247c9aa4a1d5372c3cfc5f432f0119b697625eb3bcd86a","observation_id":"68bfd8d5-120c-483e-b1f6-8457b7942daf","resolution":{"observed_at":"2026-08-07T22:19:19.335520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04267","last_updated":"2024-10-24T23:12:55Z","snapshot_observed_at":"2026-08-03T12:15:52.358095Z","submitted_at":"2024-06-06T17:14:44Z","title":"Transformers need glasses! Information over-squashing in language tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04267","snapshot_observed_at":"2026-08-07T22:19:19.341069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.341069Z"},"links":{"cited_paper":"/paper/2406.04267","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:804b9ac9cf1752cb5b08f97135e4d9b996da123536f11b8dda03b6eeb193cbf5","observation_id":"1b1d5bd0-d54f-47a9-bdd1-3d3b4f9288be","resolution":{"observed_at":"2026-08-07T22:19:19.341069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.346494Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.346494Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:f65fa301d534292a449154df96ff7fe25bf676309d1e55223ee25d7680fbb5b2","observation_id":"33fd3f29-44e9-4d41-b06e-a3a20510b22c","resolution":{"observed_at":"2026-08-07T22:19:19.346494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T22:19:19.351787Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.351787Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:01e0e5ac4fa7600d23ef76ad82de12f4a845c392fa0818781abc9e8666cf0253","observation_id":"00e310b6-3e27-4074-b52c-906ae8674f8a","resolution":{"observed_at":"2026-08-07T22:19:19.351787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.932621Z","title":"Cross-layer retrospective retrieving via layer attention","venue":null,"work_id":"7f3e55d3-9a0d-4d5d-a26b-01bbb829775f","year":2023},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.357753Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:e773defafa4d3e5240cc1cc02acea3a5cb93a97c29329967faa151eabd5cc2d8","observation_id":"f5e28eae-97cd-44e2-b0dd-d2dc482954c0","resolution":{"observed_at":"2026-08-07T22:19:19.937741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15408","last_updated":"2023-12-23T02:39:56Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:59:21Z","title":"Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15408","snapshot_observed_at":"2026-08-07T22:19:19.363191Z","title":"Towards revealing the mystery behind chain of thought: A theoretical perspective, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.363191Z"},"links":{"cited_paper":"/paper/2305.15408","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:454a78d7cb42e73e7627522ea50a5c480a275618154787f8e307c93711bca325","observation_id":"184f420e-92ae-4194-8dea-899d54591397","resolution":{"observed_at":"2026-08-07T22:19:19.363191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T22:19:19.368162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.368162Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:d105194207e2492357a2f9eb3dd0165c58ccc01953fba7820be6481e51d95f29","observation_id":"4895227a-d591-434a-91f7-b5720c62755f","resolution":{"observed_at":"2026-08-07T22:19:19.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.373196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.373196Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:d856f9cc7639e5917a668a1b5d969270407c5aca29415476aed05f4bd6d64c94","observation_id":"56a92559-7797-4607-98ec-c52b3d043920","resolution":{"observed_at":"2026-08-07T22:19:19.373196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-07T22:19:19.377584Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.377584Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:66464b59c2485c4dd1f811a05fb36f246422e34a84eacd5deb15f92bb66c8adf","observation_id":"5a68f642-fa77-4e73-a65b-5f07056c2f1a","resolution":{"observed_at":"2026-08-07T22:19:19.377584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T22:19:19.383023Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.383023Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:0caa402bebceafba95b0dc5e064cf08a8b62aa10fce5503df7f16ab8e3201363","observation_id":"c137ac98-8cf8-4623-a0c1-b6523233af9b","resolution":{"observed_at":"2026-08-07T22:19:19.383023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.06993","last_updated":"2018-01-28T17:12:02Z","snapshot_observed_at":"2026-08-06T14:53:46.539388Z","submitted_at":"2016-08-25T00:44:55Z","title":"Densely Connected Convolutional Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.06993","snapshot_observed_at":"2026-08-07T22:19:19.387575Z","title":"Weinberger","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.387575Z"},"links":{"cited_paper":"/paper/1608.06993","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:6458364e654da39e9dc529c501699fd55b38cae3a4b3f4cb5ad4c61372513059","observation_id":"eaa5c77f-73dc-4ea7-bbd7-97ec9f8671af","resolution":{"observed_at":"2026-08-07T22:19:19.387575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T22:19:19.392673Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.392673Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:b0e7e2c1c88d0995942587f0371cd8a7684b967003ee11888a8d3903e22de653","observation_id":"a4f8e83e-eb62-40d6-943b-39d6fb03b7f3","resolution":{"observed_at":"2026-08-07T22:19:19.392673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T22:19:19.397606Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.397606Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:22eb11f29dcd7396de368107a0625bffd05e67fcaa24093b0fe8d8ef9910a3f0","observation_id":"ebdd62fe-3068-4f68-8286-a9f14a22b54f","resolution":{"observed_at":"2026-08-07T22:19:19.397606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T22:19:19.402657Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.402657Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:99e9283725498739059949145c64d51fd62f588eccccd27c6365cc689af83809","observation_id":"fcbae81a-9a72-417d-9bed-31996a5d7bfb","resolution":{"observed_at":"2026-08-07T22:19:19.402657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T22:19:19.407408Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.407408Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:bcfea7cfa426787cb1a9e80d44716ac408655414af96436743bf00efd9f86304","observation_id":"02f2f10a-b574-4513-af88-8137025dbf9d","resolution":{"observed_at":"2026-08-07T22:19:19.407408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.917224Z","title":"Brown, Adam Santoro, Aditya Gupta, Adri \\` a Garriga - Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":"2f538730-850b-4178-b47f-fa9c17129693","year":2023},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.412128Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:4cc911335fe212426ee325c8c72f1de3b1f67a63a0db75ad89e18fa7200e767f","observation_id":"dbb996fa-0f7e-4f7b-829a-9b1bd4b4016e","resolution":{"observed_at":"2026-08-07T22:19:19.922131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00387","last_updated":"2015-11-03T18:15:15Z","snapshot_observed_at":"2026-07-06T04:16:46.012738Z","submitted_at":"2015-05-03T01:56:57Z","title":"Highway Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00387","snapshot_observed_at":"2026-08-07T22:19:19.417270Z","title":"Highway networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.417270Z"},"links":{"cited_paper":"/paper/1505.00387","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:9509628c5c662216bdecd9a5aa9dfbecbc5f84b2dbef53c74cc072a193ccd0b2","observation_id":"49476ed6-7d97-43f4-bdb1-2837a818e3aa","resolution":{"observed_at":"2026-08-07T22:19:19.417270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.422329Z","title":"BERT rediscovers the classical NLP pipeline","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.422329Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:fab19b1371589e71e2383b609feddca7769fbc3049c268d59da0b9b41cf8873e","observation_id":"5620c4a7-b5ef-42be-92cc-80a91626fe52","resolution":{"observed_at":"2026-08-07T22:19:19.422329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.899326Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"887f484c-6de5-4d69-aaa6-69cd4e32324b","year":2017},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.427638Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:5034d054f6ae34121f3de7093cff2a8bbc9ed26d7cda71afb5ca1504d707c46d","observation_id":"b1f71636-f643-4ec9-8c73-0a6b125f8c80","resolution":{"observed_at":"2026-08-07T22:19:19.905922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.432329Z","title":"The bottom-up evolution of representations in the transformer: A study with machine translation and language modeling objectives","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.432329Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:09b15cfc857fcd45fcef0e8731e290fa0cc0507b18ac94eefc741956a6456540","observation_id":"bfc2dddb-eaa3-48d8-9035-c6750cdef67c","resolution":{"observed_at":"2026-08-07T22:19:19.432329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.874983Z","title":null,"venue":null,"work_id":"5ad72592-7db0-4d79-a226-d8b767a523fe","year":2018},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.437125Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:56d4a6eec3b49ed7012bc0b447d3a0d578d26ccf71ef734bbe4428e0991246f0","observation_id":"e724aa8b-db05-4c0e-88af-fa56537303e9","resolution":{"observed_at":"2026-08-07T22:19:19.879645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.858548Z","title":null,"venue":null,"work_id":"720076d1-f796-4678-8a43-b3b3ead95960","year":2019},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.441545Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:872e411ade62854c849e8ec5be6222809a03bc91d5b0e1fae8cf4c78425f02e2","observation_id":"456470ef-0104-4e56-a218-7e05bed154ea","resolution":{"observed_at":"2026-08-07T22:19:19.863424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.842214Z","title":"Chi, Quoc V","venue":null,"work_id":"deeb4ea9-e3f7-4801-8503-cd6fafa7ca2f","year":2022},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.445844Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:b4d58a598a573487e9ab1bf16e701e7cde40fbc6bbf80b144df01baf194de358","observation_id":"556b6f27-066e-4195-b6c1-28719019440b","resolution":{"observed_at":"2026-08-07T22:19:19.847809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:19:19.450438Z","title":"Hiformer: Sequence modeling networks with hierarchical attention mechanisms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.450438Z"},"links":{"citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:0d8c2fd446577148190af482c168794b0cb0635a051a02ba32817f8826b8a3a2","observation_id":"7bafff4d-b797-4683-859c-0af3c6726097","resolution":{"observed_at":"2026-08-07T22:19:19.450438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19606","last_updated":"2025-03-18T10:12:54Z","snapshot_observed_at":"2026-07-06T19:24:03.133851Z","submitted_at":"2024-09-29T07:57:07Z","title":"Hyper-Connections","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19606","snapshot_observed_at":"2026-08-07T22:19:19.455902Z","title":"Hyper-connections","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T22:19:19.455902Z"},"links":{"cited_paper":"/paper/2409.19606","citing_paper":"/paper/2502.09245"},"observation_digest":"sha256:31a42acb4d61b21f5bb3836a8381a8c58d881ea51755ea09d6ca3cd049454e5a","observation_id":"94ae3df3-92cc-4e9f-8f58-fb68f51ecd91","resolution":{"observed_at":"2026-08-07T22:19:19.455902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09245","last_updated":"2025-05-28T11:04:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:08:40.535014Z","submitted_at":"2025-02-13T12:00:50Z","title":"You Do Not Fully Utilize Transformer's Representation Capacity"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2502.09245."}