{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:003c3076b99c6e219095f4aeb5a84b878741ef33956291bbf2005adb4a2f52a9","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:39:49.827447Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27230/citation-record","integrity":"/paper/2607.27230/integrity","json":"/paper/2607.27230/citation-record.json","paper":"/paper/2607.27230"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T01:39:47.618608Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.618608Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:e1be3ab1a79b5d6f0b84210972d1c1441e63a0f020a57815f107acdf0eba5e15","observation_id":"728e9bfb-469e-4fb0-a36a-4ab7e731f525","resolution":{"observed_at":"2026-08-04T01:39:47.618608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.569360Z","title":"This is the loss-level counterpart of the width-isolated disagreement in Table 6 (which rises 0.235→0.281 over the same widening)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.569360Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:0b29f43e72869574947616512076e4ae00ce1f99c10b519ed5156e69d5ab1664","observation_id":"5f87f737-1654-432c-b6d6-123c36b929e5","resolution":{"observed_at":"2026-08-04T01:39:49.569360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-08-04T01:39:47.758808Z","title":"Manifold-constrained hyper-connections.arXiv preprint arXiv:2512.24880,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.758808Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:a16b60aa9c5b02f56a942aaca8925cf463ba81b7b6809fd991fc7417ef8cb4e3","observation_id":"3f3ca8a2-f101-455b-bb99-d121b105a5cf","resolution":{"observed_at":"2026-08-04T01:39:47.758808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.451208Z","title":"This control is a self-contained 5×10 −4 comparison on the web corpus, so its d512 deltas differ slightly from Table 10’s tuned-rate (1×10 −3) numbers","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.451208Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:66e1267101a94bc2b4a1ae329c4a082892fad692c89f293b5c5a1bb72bb4d938","observation_id":"1c3ef572-3e4e-4748-ac27-05cfea4c7845","resolution":{"observed_at":"2026-08-04T01:39:49.451208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-04T01:39:48.142895Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.142895Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:ec0535c615c7e9fb17fcdfbcd12a8e1fe1591f79c30fce90aef0a625ec4b6057","observation_id":"066941b7-06c5-4da0-b5ea-677bcaf10f87","resolution":{"observed_at":"2026-08-04T01:39:48.142895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-04T01:39:48.300907Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models.arXiv preprint arXiv:2404.02258,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.300907Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:870805d8db89c15e5ab4028900b8e641f76a27a9fef778b172a8f34c191d3bbf","observation_id":"11a3f45a-48b3-48c5-96c1-dc835482131c","resolution":{"observed_at":"2026-08-04T01:39:48.300907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-04T01:39:48.498444Z","title":"Deepnet: Scaling transformers to 1,000 layers.arXiv preprint arXiv:2203.00555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.498444Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9b8356d1612f7d58414fdf441648ade914bcb30d13439de672b5ca21baf75c5c","observation_id":"3b4514cd-824d-47b6-a1ff-8b93512acde5","resolution":{"observed_at":"2026-08-04T01:39:48.498444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.00417","snapshot_observed_at":"2026-08-04T01:39:48.637581Z","title":"Deep delta learning.arXiv preprint arXiv:2601.00417, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.637581Z"},"links":{"cited_paper":"/paper/2601.00417","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:163d18f45c64ca88266c8ed78d9ce3bb8458c369d61ea1b49d67ccf1372e962d","observation_id":"1b4b545e-1df6-442e-887d-8467c30f4459","resolution":{"observed_at":"2026-08-04T01:39:48.637581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.762582Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.762582Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:72b0f1c522094876320973e048d37c5032fc2cee49be919a0ab38c1c15107573","observation_id":"2440badd-7c79-4ad8-a11c-bebdd9b04be3","resolution":{"observed_at":"2026-08-04T01:39:48.762582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.845383Z","title":"DenseNets [Huang et al., 2017] instead concatenate all previous feature maps, giving each layer direct access to every earlier one","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.845383Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:e5f38ea2d3ea4d9aabd817a90f93c226c99629992a1c6f855bbd0f77b5232dc3","observation_id":"1f04883f-7124-4e14-b24a-b76a06508a4f","resolution":{"observed_at":"2026-08-04T01:39:48.845383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.951279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.951279Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:d2b32d94c7f72485921f817f67a5d48ba0045deb812b19e5ea4d5b4a63804be6","observation_id":"57b1671f-e634-491e-829c-25da364d1fca","resolution":{"observed_at":"2026-08-04T01:39:48.951279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.073527Z","title":"\"\"Single-head depth routing = attention residuals (Kimi 2025): 3one shared query, one softmax over depth, read by all D coords. 4Equals the MHAR route at H=1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.073527Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:55322647ce7830a018177b1e4a64060acc6bacfd7d242b1447ba6c025557cda7","observation_id":"3de68183-1647-46f1-a52b-0fc0f9eb984e","resolution":{"observed_at":"2026-08-04T01:39:49.073527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.154723Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.154723Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:840b3266ac1089a4fb4a9d1db238e04a71d0d52ffcd607f89139b351792ea3f8","observation_id":"facae91e-418f-4e50-97d6-62e00a0dc625","resolution":{"observed_at":"2026-08-04T01:39:49.154723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.279598Z","title":"1def route_bwd(V, W, dout, dV, dq_part, dg_part):# one program per pos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.279598Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:37d2c269f97470666f114fb81bf7c26b34673481ce6f55297620283c3a9400b5","observation_id":"c49e995e-a5b1-42dc-8414-8c458585ca37","resolution":{"observed_at":"2026-08-04T01:39:49.279598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.745960Z","title":"The two runs are identical except for the routing mechanism (same node, software, data order, and global batch)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.745960Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:a0188b56caa1ee4f5ec3aea8f71125cc38a580491bb01028bd2c03996ab7e3c9","observation_id":"acec9d32-567d-49a0-842f-c2ec04ea46e2","resolution":{"observed_at":"2026-08-04T01:39:49.745960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.827447Z","title":"Documents are streamed from the corpus shards, joined with the end-of-text token (id 151,645), and packed into contiguous sequences of length T with no padding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.827447Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:8819aa63b049d3e6048987b5227753b939f27359acacb4a71b5521fd787e7e5c","observation_id":"c97f8e7b-24f5-447a-aa26-f057f1ce44bc","resolution":{"observed_at":"2026-08-04T01:39:49.827447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-04T01:39:48.386899Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.386899Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:6656aad253259a5e5c38ce8524d0dfea7f4fb71deca61f26b4629e79a36b77ad","observation_id":"a1f35164-2779-4fc8-84ae-617baf6f448c","resolution":{"observed_at":"2026-08-04T01:39:48.386899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-04T01:39:48.074782Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.arXiv preprint arXiv:2406.17557,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.074782Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9cbaaa728c518141b07b46bc35bf2818800047a336747f4400609fec036a7bf5","observation_id":"5b4d62da-a1ce-4e72-9d89-e3afa7859275","resolution":{"observed_at":"2026-08-04T01:39:48.074782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-04T01:39:47.872763Z","title":"Finepdfs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.872763Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:8add31b2dc51cc6034c2155c4592d40eb2c8c6cdc318b65ec853b75cc5087016","observation_id":"bd5aa1d8-db5a-42db-a10d-2648fef6ea78","resolution":{"observed_at":"2026-08-04T01:39:47.872763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18855","last_updated":"2026-05-13T16:05:30Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T16:05:30Z","title":"Delta Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18855","snapshot_observed_at":"2026-08-04T01:39:47.959950Z","title":"Delta attention residuals.arXiv preprint arXiv:2605.18855,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.959950Z"},"links":{"cited_paper":"/paper/2605.18855","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:3794ea50cd9af7216db4b574e932fb40cdb651aaa06808e187cc5d43965c29f7","observation_id":"7b329004-10d6-4462-83c2-3c2d4c8f0fc0","resolution":{"observed_at":"2026-08-04T01:39:47.959950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T01:39:47.559252Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.559252Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:1d4f9feb875ebbbc057ac272d1b76f25b5725ea652fe68a9f9906411b5390655","observation_id":"1879db55-f1bc-43f6-a35b-bbed25a828e3","resolution":{"observed_at":"2026-08-04T01:39:47.559252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07413","last_updated":"2023-12-12T16:34:19Z","snapshot_observed_at":"2026-07-06T17:00:33.386675Z","submitted_at":"2023-12-12T16:34:19Z","title":"AI capabilities can be significantly improved without expensive retraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07413","snapshot_observed_at":"2026-08-04T01:39:47.687200Z","title":"AI capabilities can be significantly improved without expensive retraining.arXiv preprint arXiv:2312.07413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.687200Z"},"links":{"cited_paper":"/paper/2312.07413","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:2ed7cfa17bc2f96d000b519b3937d8382c4e9a915ea18ad6ebc29f11c5259766","observation_id":"4cc59b98-1840-4561-9278-3d5203a95c98","resolution":{"observed_at":"2026-08-04T01:39:47.687200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T01:39:47.523424Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.523424Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:6ead33e3e44e3bf6c1c0ea0de592cfc9651842bd0908115b56b0bc0251231bef","observation_id":"a434357d-c39c-4d8e-8c1c-98c850430191","resolution":{"observed_at":"2026-08-04T01:39:47.523424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:47.822580Z","title":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.822580Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:323740341728ce5dbc45c787cd79841b1fafb877e874d24458475370a6986eda","observation_id":"480fa5e1-fb6a-4b47-b397-75347d8550e0","resolution":{"observed_at":"2026-08-04T01:39:47.822580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T01:39:48.221064Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.221064Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:a6a4f2bcc0f628d04d10764b8b7372d1c909ab485ae70244f1687cb1cb0b2138","observation_id":"cfb25400-5397-4712-bb6d-1b422a71d696","resolution":{"observed_at":"2026-08-04T01:39:48.221064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02622","last_updated":"2024-03-21T10:57:40Z","snapshot_observed_at":"2026-08-05T10:38:23.917277Z","submitted_at":"2024-02-04T21:44:09Z","title":"DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02622","snapshot_observed_at":"2026-08-04T01:39:48.022554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.022554Z"},"links":{"cited_paper":"/paper/2402.02622","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:a85135a8e4c885d4ef5a63b5309ef042c2e590c1273da05f8cd76f529e7c4dfd","observation_id":"88939309-ecc3-4dce-96b2-19a208537475","resolution":{"observed_at":"2026-08-04T01:39:48.022554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T23:11:28.294466Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.27230."}