{"as_of":"2026-08-08T22:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b220aa3c557276bec1b081bbffefdd7fd70071ada3beea899d9be9979366140a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:11.857239Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":54,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T16:22:08.801066Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2205.14135"},"observation_digest":"sha256:ea225e2aa15dcdadd14592541fdebbfce9f5d22dce4e989227626ed0750a594e","observation_id":"2d3a80d7-d25f-4d34-b7a9-5dae2e110da1","resolution":{"observed_at":"2026-05-12T16:22:08.887842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T18:32:22.813668Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2302.14045"},"observation_digest":"sha256:6c862b7c3d5d0118915aaf11c65f5f886862312edf3f075b19c3b4cc393f47cf","observation_id":"f30cc71f-b14a-40bb-b558-4b59c1b0fced","resolution":{"observed_at":"2026-05-15T18:32:22.873613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":282,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:c987e3d071b25dfa1a9d63a56392802b8dda7da46f3e24816c0e7889d273e30d","observation_id":"4809d27e-dd9a-4897-b631-e2f5347ecf70","resolution":{"observed_at":"2026-05-10T22:46:40.725925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:25efe53ce29294f7bbaae46201c96e4f7aebbcef7fcfa2e26e6246193a5d09c7","observation_id":"1298970c-a84f-4672-b77e-b7ccfaab61fa","resolution":{"observed_at":"2026-05-17T18:00:50.233161Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:01c8a94da035451fbd6fb6c38d339f54ed5c37bf8024440be6a482feb8ec403b","observation_id":"1b15f8d7-71c9-4b3f-876f-084f39a99204","resolution":{"observed_at":"2026-05-19T20:28:39.286410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T20:29:59.633357Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2307.08621"},"observation_digest":"sha256:963599bf2bad34b054be829ecd6ed9bb0f6aab9c9cc5fcc7baeb6ef0cae5cc84","observation_id":"6f5ab099-0aec-47a4-b763-4e01a88edbb7","resolution":{"observed_at":"2026-05-11T20:29:59.737427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:054877028e588db1a002ccc84788be204cee5a252ea0a1e86a65901e99170860","observation_id":"a1019b78-1466-4b3d-8e4a-39007fabba98","resolution":{"observed_at":"2026-05-12T09:04:34.938109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-07T13:26:11.857239Z","title":"Deepnet: Scaling transformers to 1,000 layers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21910","last_updated":"2025-05-28T02:55:28Z","snapshot_observed_at":"2026-08-07T13:17:18.355133Z","submitted_at":"2025-05-28T02:55:28Z","title":"Taming Transformer Without Using Learning Rate Warmup","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:26:11.857239Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2505.21910"},"observation_digest":"sha256:b4878df9f83da2b3fd66ff34cffcb09fc1b3682dfe4a4950e8d6357c76e6ce8b","observation_id":"c5041f34-d033-4787-b3bf-16da13f0a5b6","resolution":{"observed_at":"2026-08-07T13:26:11.857239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T14:24:16.800803Z","title":"Deepnet: Scaling transformers to 1,000 layers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21380","last_updated":"2026-06-10T10:31:06Z","snapshot_observed_at":"2026-08-08T02:30:50.644153Z","submitted_at":"2025-08-29T07:51:45Z","title":"The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T14:24:16.800803Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2508.21380"},"observation_digest":"sha256:8f02562915a87192a68653efd1dbda1b3dee66964c158c6c0a90972a5482fbc9","observation_id":"c3fabdea-9f73-48c5-8c82-7cf8c357bba6","resolution":{"observed_at":"2026-08-05T14:24:16.800803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2602.10408","last_updated":"2026-05-19T21:29:01Z","snapshot_observed_at":"2026-08-01T12:13:46.685645Z","submitted_at":"2026-02-11T01:40:34Z","title":"Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T14:19:46.400753Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2602.10408"},"observation_digest":"sha256:7e63ddb350d3b72b02cbcaead8f7ef8a01236f8a13560830c02e097a45e0bb63","observation_id":"4979db94-aa97-440e-a0f4-16e9ca7455cf","resolution":{"observed_at":"2026-05-21T14:20:13.500759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:9c1812cc6dea26825dd5b2265f7fbbf61d29c214f2bd29df0e24f4ddf07fed77","observation_id":"9f5b1146-dfed-49fb-8341-7c72123b16ed","resolution":{"observed_at":"2026-05-21T06:39:04.447997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-07-14T20:29:33.439034Z","title":"Deepnet: Scaling transformers to 1000 layers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.15389","last_updated":"2026-06-27T04:53:36Z","snapshot_observed_at":"2026-08-01T17:36:36.240938Z","submitted_at":"2026-03-16T15:04:16Z","title":"When Does Sparsity Mitigate the Curse of Depth in LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T20:29:33.439034Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2603.15389"},"observation_digest":"sha256:7ebf825396e807b2010c95eef9194af0f585adbf07ddace9f41c8bf3a96e2357","observation_id":"ae21a8cb-1144-436d-9275-5c41827c84ea","resolution":{"observed_at":"2026-07-14T20:29:33.439034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2605.18855","last_updated":"2026-05-13T16:05:30Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T16:05:30Z","title":"Delta Attention Residuals","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T20:55:29.257097Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2605.18855"},"observation_digest":"sha256:a830cd8eda8f106ef00aef1ff546cbe7a55591536f6ac871fc5c008182c90ed9","observation_id":"eb4ec1ad-925a-4957-bf1b-2ff4e44b2321","resolution":{"observed_at":"2026-05-20T20:59:01.842019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2605.18878","last_updated":"2026-05-16T02:49:12Z","snapshot_observed_at":"2026-08-02T22:07:15.605820Z","submitted_at":"2026-05-16T02:49:12Z","title":"Prognostic Value of Lung Ultrasound Biomarkers for Readmission Risk in Congestive Heart Failure: A Pilot Data-Driven Analysis","version":1},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-05-20T15:41:31.181025Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2605.18878"},"observation_digest":"sha256:35f7b0ee15d72fbca6b31d78ec3df0542d15e72f13ff33d8fe14708b9c15a610","observation_id":"a55527ee-9603-4700-980d-b86a5cc646a0","resolution":{"observed_at":"2026-05-20T15:43:26.396967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2606.06564","last_updated":"2026-06-17T07:56:14Z","snapshot_observed_at":"2026-08-06T22:40:50.901488Z","submitted_at":"2026-06-04T16:15:27Z","title":"HAARES Half-Split Residual Basis Routing for Deep Transformers","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T03:12:38.612580Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2606.06564"},"observation_digest":"sha256:2e0f7b99691114ef4ae5d4406c179be2b9d1a5a0a59492a76e36d5858cfcbb50","observation_id":"bf866434-9986-41cb-9eb1-a100cf4345bc","resolution":{"observed_at":"2026-07-02T11:36:55.424558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2606.24898","last_updated":"2026-06-12T13:23:18Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-12T13:23:18Z","title":"Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T04:27:48.590008Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2606.24898"},"observation_digest":"sha256:045ddbb8b83883e4505d856776a9bc17d8cf2ebc788c8bf99df5421bbf2199fa","observation_id":"25bf54da-2c13-4d58-83eb-668bb44d8c1b","resolution":{"observed_at":"2026-07-03T17:08:44.043563Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2606.26538","last_updated":"2026-06-25T02:25:00Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T02:25:00Z","title":"CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T05:22:26.818078Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2606.26538"},"observation_digest":"sha256:a80271e3c74a179096977a8fd5ed7336d51d36cd4ab18ba24e1c59c33a2c988a","observation_id":"29b3ba39-91ba-46e7-8dac-bc818def2ea9","resolution":{"observed_at":"2026-06-26T05:29:00.082328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2606.31859","last_updated":"2026-06-30T15:53:27Z","snapshot_observed_at":"2026-08-06T09:39:23.967967Z","submitted_at":"2026-06-30T15:53:27Z","title":"Review Residuals: Update-Conditioned Residual Gating for Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T06:38:06.546686Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2606.31859"},"observation_digest":"sha256:2921190621ff267e172f853a79e306427428520f4a0343717a66a2248195a1c5","observation_id":"d1beed07-4ff1-4138-b2c3-1e679ea7d257","resolution":{"observed_at":"2026-07-01T06:45:29.860060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"DeepNet: Scaling transformers to 1,000 layers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:1058a1275809b14644c676e39b19379f2363dd88c065f6a010b340ec88281841","observation_id":"a5f73626-9260-4004-bab3-cfcd8552fb0b","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-01T00:35:16.992424Z","title":"arXiv preprint arXiv:2203.00555 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26192","last_updated":"2026-07-28T18:51:11Z","snapshot_observed_at":"2026-08-08T02:04:55.424759Z","submitted_at":"2026-07-28T18:51:11Z","title":"Dynamic Parameterization Is Not Dynamic Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T00:35:16.992424Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.26192"},"observation_digest":"sha256:ba339cfd513467f73e17ff89a9ade147306531d30adcbe14a3fc92dc964ebe0f","observation_id":"41a76f9c-c9e8-4c07-9061-6ae57e9dfcc8","resolution":{"observed_at":"2026-08-01T00:35:16.992424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-01T11:39:23.618991Z","title":"Deepnet: Scaling transformers to 1,000 layers.arXiv preprint arXiv:2203.00555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:39:23.618991Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:019504b71f30a257226695b1f5bca2b5c79ceb21a9c43cbbba360c185bc921d4","observation_id":"a5b95787-2b6c-41e1-8e86-3381df5de39a","resolution":{"observed_at":"2026-08-01T11:39:23.618991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-04T01:39:48.498444Z","title":"Deepnet: Scaling transformers to 1,000 layers.arXiv preprint arXiv:2203.00555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.498444Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9b8356d1612f7d58414fdf441648ade914bcb30d13439de672b5ca21baf75c5c","observation_id":"3b4514cd-824d-47b6-a1ff-8b93512acde5","resolution":{"observed_at":"2026-08-04T01:39:48.498444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.00555/citation-record","integrity":"/paper/2203.00555/integrity","json":"/paper/2203.00555/citation-record.json","paper":"/paper/2203.00555"},"outbound":[],"paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2203.00555."}