{"as_of":"2026-08-19T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55a8f935a5fb35ed403d7781505ad3b54840b33a36b44aac6f7790bc96d6e50a","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:50:59.403092Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T01:55:09.658053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:51.249567Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"cited_work":{"arxiv_id":"2506.01969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01969","snapshot_observed_at":"2026-07-11T01:57:51.249567Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","venue":"cs.DC","work_id":"a199399f-70f6-43f3-ba61-fdc0a7033141","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2506.01969","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:d339533d5c52b09bb9ff09f9fd33a4549466238c4799bdbf5be7a6c115b8349d","observation_id":"668fa2d6-7176-4e49-ac2e-3529b01a39c7","resolution":{"observed_at":"2026-07-08T22:45:40.093828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"cited_work":{"arxiv_id":"2506.01969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01969","snapshot_observed_at":"2026-07-11T01:57:51.249567Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","venue":"cs.DC","work_id":"a199399f-70f6-43f3-ba61-fdc0a7033141","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2506.01969","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:46ab34729803366fdcd99f22fb5d5056720118815ec5a4dadb1dd59cc628c4d0","observation_id":"627a9baf-3ed6-436d-8de6-f76ea77c37e2","resolution":{"observed_at":"2026-07-11T01:57:51.281954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01969/citation-record","integrity":"/paper/2506.01969/integrity","json":"/paper/2506.01969/citation-record.json","paper":"/paper/2506.01969"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.805700Z","title":"In: Guyon, I., Luxburg, U.V., Bengio, S., Wallach, H., Fergus, R., Vishwanathan, S., Garnett, R","venue":null,"work_id":"f9535825-bb24-4d4f-bebf-168220d30928","year":2017},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.327879Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:219d7653b1a5fca27aaab73c8826e9202d2a916b2d5c7e0ac2474d117dbc0a31","observation_id":"19bf4709-fd63-43f6-9afb-3c0118487b4e","resolution":{"observed_at":"2026-08-15T21:50:59.809803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.332548Z","title":"In: Burstein, J., Doran, C., Solorio, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.332548Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:30390a706df9d1d43b5915566a2434111a69d6dca75ef7a84a24d1a041f309fb","observation_id":"dc128f2d-17ac-40f6-a60a-bfb08fef5793","resolution":{"observed_at":"2026-08-15T21:50:59.332548Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T21:50:59.336297Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.336297Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:9dbf3684a6e91e20235da1b998ea12e2f0decad81a32de4533427b700f9d0712","observation_id":"8253e9a0-f5e6-491f-b181-7f8ea0794ded","resolution":{"observed_at":"2026-08-15T21:50:59.336297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.794283Z","title":"In: Meila, M., Zhang, T","venue":null,"work_id":"bbf42e96-b4bb-42bd-ac46-a14c7576df5a","year":2021},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.340032Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:12d905b1dece40f6632b3db990fb3b3ff1a83a614c92573f5bc8ee6d39794fc0","observation_id":"07b3c921-e9d5-480f-9ad8-3a59d3f2d39a","resolution":{"observed_at":"2026-08-15T21:50:59.797996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T21:50:59.343751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.343751Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:3648f04dfcf35e56fd46d802eb9f97ac13cf94d4b3ea656b62c8a65e36696cc5","observation_id":"4421f8a3-e26e-409a-b078-199aa00b7b5b","resolution":{"observed_at":"2026-08-15T21:50:59.343751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T21:50:59.347941Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.347941Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:f489bc955bb30df073bbc1b583f751ba03caa492890ee7661fe50c437ce7ed46","observation_id":"1363dff7-f4a6-4965-9021-6bf35f7d3302","resolution":{"observed_at":"2026-08-15T21:50:59.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T21:50:59.351682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.351682Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:fb22e4c682daa4b7e7c4418b8c48bb87441268ec57bd86ad11a27393f640efda","observation_id":"bd08d5fc-070f-45c5-8335-3e836b213fa2","resolution":{"observed_at":"2026-08-15T21:50:59.351682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.783123Z","title":"In: Koyejo, S., Mohamed, S., Agarwal, A., Belgrave, D., Cho, K., Oh, A","venue":null,"work_id":"0b25c9d5-a074-458d-af3b-6d948616bb10","year":2022},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.355698Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:66710e2f3eee9b4dac0b3c84dedddbf6ecee05db336a789b273d752277ff08d0","observation_id":"b9f9c228-b719-4657-b8a7-7e57a3684841","resolution":{"observed_at":"2026-08-15T21:50:59.787243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T21:50:59.359390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.359390Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:2138c8b05d578026d9ed59662f15773cae2b55c8c5e877d8ab843cba7057a52c","observation_id":"f7bb8a33-a6f2-48b1-9709-46e1be3a8701","resolution":{"observed_at":"2026-08-15T21:50:59.359390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-15T21:50:59.363438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.363438Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:64c6d29d5b7570a84f06952c8457ae393106e26c3ef5f77e9ee9df739c6f9169","observation_id":"087e3237-e088-4669-8367-26b8cc2ad5b6","resolution":{"observed_at":"2026-08-15T21:50:59.363438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.367000Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.367000Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:ef1196407ce4ce6acc9c0eb287d182f7f95078dba96e28deb2d54ec380fdaa30","observation_id":"59d9ae77-800f-42f4-a03d-3776e8d6ab72","resolution":{"observed_at":"2026-08-15T21:50:59.367000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.771573Z","title":null,"venue":null,"work_id":"59f6a433-5daa-443c-aeca-41f767919c9e","year":2025},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.370208Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:6da99fb816b6cd8b0f6eb4a2ffb51626a3c5fe6c4886ad385c572eab6de22912","observation_id":"d9c6f7aa-3939-438c-8908-be6f87a4f08f","resolution":{"observed_at":"2026-08-15T21:50:59.775344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-15T21:50:59.373762Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.373762Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:614682d0d48c09d066c786ced3f349913a7823d0be3cba4aedd9e1744f793685","observation_id":"481c18d2-07bf-469b-b628-2209a5dc7896","resolution":{"observed_at":"2026-08-15T21:50:59.373762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12351","last_updated":"2024-02-23T19:22:58Z","snapshot_observed_at":"2026-08-16T14:41:37.707858Z","submitted_at":"2023-11-21T04:59:17Z","title":"Advancing Transformer Architecture in Long-Context Large Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12351","snapshot_observed_at":"2026-08-15T21:50:59.377829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.377829Z"},"links":{"cited_paper":"/paper/2311.12351","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:5bcd5358ca8574e6dc0f9e289eb0e9751b64111447a174be2810c5993706d333","observation_id":"a3cecf1e-9c74-4211-ae13-2f37a68c71a3","resolution":{"observed_at":"2026-08-15T21:50:59.377829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.381924Z","title":"In: Proceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.381924Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:f2b1a363a167288f1289630000433f152f2196eeb2bed69c1249d23ea5a446c5","observation_id":"f88aee9a-a2fd-4ed2-8b2a-a73c0bf564c5","resolution":{"observed_at":"2026-08-15T21:50:59.381924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:50:59.759171Z","title":null,"venue":null,"work_id":"faf9f2ba-37cf-435e-ac17-c08491f77138","year":2024},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.385478Z"},"links":{"citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:f0a24cc68fda9aa06d3b9144bf5199800eeaca9859029dbb61fe08822848f8d7","observation_id":"529f7460-8570-4473-98ef-2638c834582f","resolution":{"observed_at":"2026-08-15T21:50:59.764023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-15T21:50:59.388966Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.388966Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:e1f55e21081fef23f85a20772f88588962b335c2337eee9fbf1d56ec86af0677","observation_id":"037e9032-0e2f-4d4f-a080-7bde75c28608","resolution":{"observed_at":"2026-08-15T21:50:59.388966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T21:50:59.392738Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.392738Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:e9d01b2680106335b8fca211a574a2b09a0a7ec9504bba8fd146de50f6014eb0","observation_id":"5db7d9a0-7575-44a3-8414-150b50a49279","resolution":{"observed_at":"2026-08-15T21:50:59.392738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-15T21:50:59.396271Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.396271Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:7fcd127ab2a7c5d344fc83ea34c5c056f8fe56b5ab4ec7c5e35f9cb38e074875","observation_id":"3ea0ecf8-2cd9-4218-bf73-3eacc49ff827","resolution":{"observed_at":"2026-08-15T21:50:59.396271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T21:50:59.399750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.399750Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:a97f9889a0a4c4cada6c934ea15176d4ef0e72d6f9f3bf8981e1a76a1235c4fc","observation_id":"b1a86976-1127-4086-ae60-cfe1ee6c6f9e","resolution":{"observed_at":"2026-08-15T21:50:59.399750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-15T21:50:59.403092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:50:59.403092Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2506.01969"},"observation_digest":"sha256:3dcfebfbbc7f26b92864912b370447fd92631781260525edf92f33f3c8dd6622","observation_id":"31e1e6ce-0058-492a-96fe-d6a27d6702bd","resolution":{"observed_at":"2026-08-15T21:50:59.403092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01969","last_updated":"2026-06-02T00:53:06Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T21:44:24.840265Z","submitted_at":"2025-05-13T17:45:34Z","title":"FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2506.01969."}