{"as_of":"2026-08-12T18:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:313f181945159610f707ff546613d1d09de005bb1549b662faf96665cfc1765a","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:26:47.452553Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09160/citation-record","integrity":"/paper/2608.09160/integrity","json":"/paper/2608.09160/citation-record.json","paper":"/paper/2608.09160"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T22:26:47.350167Z","title":"Megatron-lm: Training multi-billion param- eter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.350167Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:a73586bce0db55f734d98a0d6405f27a44555a81b29c6bc2b7213399de320dda","observation_id":"34d772e3-0810-4038-bac4-75a80fa86989","resolution":{"observed_at":"2026-08-11T22:26:47.350167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.911137Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"4d517f6a-54c8-4334-b278-b5706084de36","year":2023},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.362615Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:60a73d2499a47657a96ea699f6a7e5bb460c3d796e170df93fcd30de21a47a5a","observation_id":"d0006a06-aef3-4d8a-8c54-17bf8aa7f4e7","resolution":{"observed_at":"2026-08-11T22:26:47.918531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-07T05:35:13.505081Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-11T22:26:47.368308Z","title":"Flux: Fast software-based communication overlap on gpus through kernel fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.368308Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:c15499b4445ded33f8eb365c04edeb671a44132e0541d26dad904bc8fa84acdd","observation_id":"f74c1e6c-f28a-4de2-8e5c-1af97a64e03a","resolution":{"observed_at":"2026-08-11T22:26:47.368308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.887555Z","title":"Flashoverlap: A lightweight design for efficiently overlapping communication and computation,","venue":null,"work_id":"e42294f0-c32b-49d9-be9f-bdffece205e1","year":2025},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.374690Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:22b28f72fcef3538c733dc14f96e2941fe7cd6522392d32637113ed65a04ab76","observation_id":"2cf554a0-4d14-45a4-926d-5e995d619ba1","resolution":{"observed_at":"2026-08-11T22:26:47.894254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.868585Z","title":"Scaling vision transformers to 22 billion parame- ters,","venue":null,"work_id":"bcf67373-d879-45a5-9802-d5fd3cf250b3","year":2023},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.381371Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:baaacd28ad18b79479edf634dd9d72b5538be3e15510566b85d1035b02d002f2","observation_id":"9c524e33-19a0-4916-b461-40bddfded5b8","resolution":{"observed_at":"2026-08-11T22:26:47.874911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-11T22:26:47.388569Z","title":"2 olmo 2 furious,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.388569Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:041d72fbb61b79518126d51cc929e396ae903095040238ec585143edc12d247f","observation_id":"c08adcf2-244e-465f-8c08-cbcd21b1c191","resolution":{"observed_at":"2026-08-11T22:26:47.388569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.851174Z","title":"Olmoe: Open mixture-of-experts language models,","venue":null,"work_id":"12429d4d-9b05-469e-9c51-791999198cd2","year":2025},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.397767Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:f888b4f5afe146757b5f9f08be39ea6269224de109faa9e634136523ef618ee8","observation_id":"be5b1ea6-bfe2-453f-8ffa-8188c1d28afb","resolution":{"observed_at":"2026-08-11T22:26:47.856811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-11T22:26:47.409165Z","title":"Olmo, “Olmo 3,”arXiv preprint arXiv:2512.13961, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.409165Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:b1e7b67364a3289620a635594d9dc658d07280f6ac8c9ab18526a8ae43f4a665","observation_id":"59df8745-5479-4aae-af06-4947d9697124","resolution":{"observed_at":"2026-08-11T22:26:47.409165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.417005Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.417005Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:8b0679a247c38fbd9f7140df63ce4265da8dc3ec3aa7ea261efee72a49074c13","observation_id":"57198c9f-e150-493f-a4e0-577bf2bb7b1f","resolution":{"observed_at":"2026-08-11T22:26:47.417005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.811100Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":"fdbcb848-bb20-4f72-ae20-af90a629bbc3","year":2019},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.421704Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:cdbb5bab9d009660a4416dc370b7bfc13a3fe0e8a73f49928a25b29711418146","observation_id":"ba6b7a54-91b3-4550-b68c-25f2b8952c90","resolution":{"observed_at":"2026-08-11T22:26:47.817503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.780659Z","title":"ShareGPT Dataset,","venue":null,"work_id":"9fc16b07-1bad-49e9-b00e-49bac8a638c9","year":2023},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.432274Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:a8c61567438df2e01d37627516a56610579e1db0d42d942f29b03f7c685f320b","observation_id":"42d54c11-bb7e-489f-a017-121d854e70e8","resolution":{"observed_at":"2026-08-11T22:26:47.794484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.759040Z","title":"Olmo: Accelerating the science of language models,","venue":null,"work_id":"b57fa2fd-663d-40e2-a05c-7bd419df4281","year":2024},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.440748Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:59f3d58bf430555e86878bfbe627fbfff836ffd2807a7e9a046aa2639f08b61a","observation_id":"8042f586-10b6-47cd-ac78-0c76ead1036e","resolution":{"observed_at":"2026-08-11T22:26:47.764870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.740441Z","title":"MiniMax TP RMSNorm,","venue":null,"work_id":"49b50dfd-e9d8-4e94-ad22-cb2ffb7c1906","year":2026},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.446922Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:42e402f9705fb7371ffd534c6607f635609aab24d40c86e8755ae2bcd5ca88ad","observation_id":"a020fbaf-f1b3-4106-88fe-674c6b455372","resolution":{"observed_at":"2026-08-11T22:26:47.745497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01212","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:26:47.613704Z","title":"Simplegpt: Improving gpt via a simple normalization strategy,","venue":null,"work_id":"e413f2a4-466a-4dc9-b359-2a42d42e6a0a","year":2026},"citing_paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:26:47.452553Z"},"links":{"citing_paper":"/paper/2608.09160"},"observation_digest":"sha256:ba84d791393755373f93a8530601237b68c1935dcf10a6f18364b2c086e1b21a","observation_id":"394b9cdf-c0c2-4376-8592-aaf7eb64f993","resolution":{"observed_at":"2026-08-11T22:26:47.630204Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09160","last_updated":"2026-08-10T06:16:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T18:20:48.528844Z","submitted_at":"2026-08-10T06:16:24Z","title":"SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.09160."}