{"as_of":"2026-08-09T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6302a75bfcaeb7ce4453732a3d3833b78547f4106d1e6befa488f24ad7183c44","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:19:52.425001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":28,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:2c8c739b656e4fe037fbf5cbdb2c303e8b0550ca302651b435cc67b5baed47b9","observation_id":"b1d251c3-42a8-4c44-990b-d098de0e89b2","resolution":{"observed_at":"2026-05-12T23:14:25.853489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-11T12:16:25.390683Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2405.21060"},"observation_digest":"sha256:faaa384e67bc3686d62b4506c60e1c1d2f9c03c636a3620736f8b6302fdf55fb","observation_id":"29ff6b07-a487-4db9-b543-7064dd252052","resolution":{"observed_at":"2026-05-11T12:16:25.946940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T05:20:12.134340Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2407.04620"},"observation_digest":"sha256:06c306d11db52d05baa2c939911622d0978843fcb6de12df61c5860607bd6783","observation_id":"b8b59346-a6ea-495f-bd66-e954ea21bd9e","resolution":{"observed_at":"2026-05-15T05:20:12.251119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2503.23947","last_updated":"2026-05-12T04:57:03Z","snapshot_observed_at":"2026-08-06T18:26:52.480432Z","submitted_at":"2025-03-31T10:53:42Z","title":"Spectral-Adaptive Modulation Networks for Visual Perception","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-22T22:33:48.137960Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2503.23947"},"observation_digest":"sha256:d26b20fcc9b1d55b592b60219de79bcb2e547ef2bcb9f9b47935f1f3e77176c8","observation_id":"dd02aa21-f87b-4963-999e-5fe241f90d42","resolution":{"observed_at":"2026-05-22T22:35:11.646005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-07T14:19:52.425001Z","title":"Normformer: Improved transformer pretraining with extra normaliza- tion, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19488","last_updated":"2025-05-26T04:15:38Z","snapshot_observed_at":"2026-08-07T21:30:44.646659Z","submitted_at":"2025-05-26T04:15:38Z","title":"Understanding Transformer from the Perspective of Associative Memory","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.425001Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2505.19488"},"observation_digest":"sha256:4345913d6900db3ebd15bc830f557f107b52a36f09c877fee9ea99a881426554","observation_id":"e6250802-0980-4c55-8a29-cf60446cfc06","resolution":{"observed_at":"2026-08-07T14:19:52.425001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-06T22:10:41.617138Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22696","last_updated":"2025-06-28T00:29:42Z","snapshot_observed_at":"2026-08-06T21:57:54.658992Z","submitted_at":"2025-06-28T00:29:42Z","title":"Residual Matrix Transformers: Scaling the Size of the Residual Stream","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:10:41.617138Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2506.22696"},"observation_digest":"sha256:f3d0eb53e88a873d8d7ee216716fb4735f4b4150fce38fc676357272d2c2c907","observation_id":"95eb7219-1915-42ee-8692-65a282ad4ccc","resolution":{"observed_at":"2026-08-06T22:10:41.617138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-03T18:42:13.369717Z","title":"Shleifer, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04149","last_updated":"2026-07-22T06:17:13Z","snapshot_observed_at":"2026-08-04T16:21:05.551540Z","submitted_at":"2025-12-03T19:00:00Z","title":"Enhancing next token prediction based pre-training for jet foundation models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:13.369717Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2512.04149"},"observation_digest":"sha256:3efe6905aae4cd980404a3d525d05c20890e40c94db10b1fbf029a2781255b8d","observation_id":"0b32a93d-2461-43d1-be7d-49a75c0f1de0","resolution":{"observed_at":"2026-08-03T18:42:13.369717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-03T06:37:53.244800Z","title":"Shoeybi, M., Patwary, M., Puri, R., LeGresley, P., Casper, J., and Catanzaro, B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2601.22580","last_updated":"2026-06-04T11:50:53Z","snapshot_observed_at":"2026-08-03T06:37:49.104766Z","submitted_at":"2026-01-30T05:21:57Z","title":"SpanNorm: Reconciling Training Stability and Performance in Deep Transformers","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T06:37:53.244800Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2601.22580"},"observation_digest":"sha256:b957ba85c516e7bb989480eabde5d86170325a802e4fed99f9e31ac3fac59db1","observation_id":"7b20b22d-d874-4795-bebe-a0d7a08359e0","resolution":{"observed_at":"2026-08-03T06:37:53.244800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2604.21035","last_updated":"2026-04-22T19:29:41Z","snapshot_observed_at":"2026-07-30T11:22:05.443849Z","submitted_at":"2026-04-22T19:29:41Z","title":"Masked-Token Prediction for Anomaly Detection at the Large Hadron Collider","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T23:24:59.497990Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2604.21035"},"observation_digest":"sha256:302f5615831d9baae57baeaa5515ea5dca10da12bd8e6323a5222a76333fda6a","observation_id":"87d7a6bb-26a6-40c3-8f42-a733a5103058","resolution":{"observed_at":"2026-05-11T14:11:04.347779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2605.09881","last_updated":"2026-05-11T02:11:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T02:11:47Z","title":"Dissecting Jet-Tagger Through Mechanistic Interpretability","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:09.296991Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2605.09881"},"observation_digest":"sha256:f4ecf2444c49c8187ed2f98edb0fa1a0dbedb1333af8c60926bd611edba050a2","observation_id":"21ab91d6-1470-499f-ab84-275bc0b87d66","resolution":{"observed_at":"2026-05-12T04:51:22.732285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2605.10504","last_updated":"2026-05-11T13:01:12Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:01:12Z","title":"Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:12:20.784347Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2605.10504"},"observation_digest":"sha256:656ade0297b4943bcb8d5ed17a3311eafe1a42c156e1a0a323e8dd84918d9929","observation_id":"269face2-5ba0-4007-9744-f9495e6b9bb8","resolution":{"observed_at":"2026-05-12T06:31:27.895465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2606.24898","last_updated":"2026-06-12T13:23:18Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-12T13:23:18Z","title":"Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T04:27:48.590008Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2606.24898"},"observation_digest":"sha256:b11004f7c363160a43ede09bac7f21b9d26ac634bc99297bae368ed539ec740e","observation_id":"41a74ce0-72ff-4cdc-828b-babe7507c3cf","resolution":{"observed_at":"2026-07-03T17:08:44.043355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":"2110.09456","doi":"10.48550/arxiv.2110.09456","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":"arXiv (Cornell University)","work_id":"d4198d80-d766-44cc-a2cd-c381484843b3","year":2021},"citing_paper":{"arxiv_id":"2606.26538","last_updated":"2026-06-25T02:25:00Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T02:25:00Z","title":"CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T05:22:26.818078Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2606.26538"},"observation_digest":"sha256:e528a826321041d779ff5d0a50731d21ce3635120d39cf61f68a3d7aa8587963","observation_id":"da89ef92-acd0-43fa-9443-93df1c86e530","resolution":{"observed_at":"2026-06-26T05:29:00.032144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-02T03:08:35.091316Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14018","last_updated":"2026-07-15T16:50:43Z","snapshot_observed_at":"2026-08-05T03:03:44.055926Z","submitted_at":"2026-07-15T16:50:43Z","title":"Transforming Rank: How Architecture Navigates the Spectral Pathologies of Depth","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:08:35.091316Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2607.14018"},"observation_digest":"sha256:8a75b02c45d016809a7f43b1da08324c421c90a09c49b867e33e929f6c260e42","observation_id":"900e3749-5352-4242-bdec-812979d4370d","resolution":{"observed_at":"2026-08-02T03:08:35.091316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-01T16:19:08.218424Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18363","last_updated":"2026-07-20T15:29:00Z","snapshot_observed_at":"2026-08-07T09:36:32.385604Z","submitted_at":"2026-07-20T15:29:00Z","title":"A Controlled Study of Attention-Only Transformers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:08.218424Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2607.18363"},"observation_digest":"sha256:b85123a5c3632d5320d166d9b4d0292c12fa9536a1488d9a91c3d1e4ed55588d","observation_id":"8af19852-f78d-43d3-a532-5a2890762fd4","resolution":{"observed_at":"2026-08-01T16:19:08.218424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-01T14:36:34.541050Z","title":"arXiv preprint arXiv:2110.09456 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18730","last_updated":"2026-07-21T05:42:55Z","snapshot_observed_at":"2026-08-02T19:31:53.713270Z","submitted_at":"2026-07-21T05:42:55Z","title":"Dual Attention Residuals","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T14:36:34.541050Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2607.18730"},"observation_digest":"sha256:da8854231158d4015651ec6c666590fd06f759a627e6d14b83d17d4ec8399ca9","observation_id":"4ca5af7c-1300-4e6a-9731-a7264367390f","resolution":{"observed_at":"2026-08-01T14:36:34.541050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2110.09456/citation-record","integrity":"/paper/2110.09456/integrity","json":"/paper/2110.09456/citation-record.json","paper":"/paper/2110.09456"},"outbound":[],"paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T11:59:11.865133Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2110.09456."}