{"as_of":"2026-08-11T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:483cf37216a4d4c45faa923574b60ce5e177c0b1253015225a5ee2b7086bd1af","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T01:59:30.583027Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T16:41:30.021302Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-19T16:42:39.697093Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"cited_work":{"arxiv_id":"2511.03092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.03092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","venue":"cs.AI","work_id":"d1525fbc-067e-4db8-8885-041773f05c2c","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:13.353700Z"},"links":{"cited_paper":"/paper/2511.03092","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:c080fa797662c8990eba1ee5f56e653b581bfef0cb96f0d1836d43b292698eed","observation_id":"e829cb08-ae8e-4dbd-b782-834e68d6103a","resolution":{"observed_at":"2026-05-11T08:06:01.095894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"cited_work":{"arxiv_id":"2511.03092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.03092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","venue":"cs.AI","work_id":"d1525fbc-067e-4db8-8885-041773f05c2c","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:48:21.341462Z"},"links":{"cited_paper":"/paper/2511.03092","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:73f2981985b420175890934907a6768a85f7ab020cd34971100999baac4320d6","observation_id":"93f452a5-a4c8-499b-95c8-86e6ac9d5f5f","resolution":{"observed_at":"2026-05-11T04:20:56.323193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"cited_work":{"arxiv_id":"2511.03092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.03092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","venue":"cs.AI","work_id":"d1525fbc-067e-4db8-8885-041773f05c2c","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T07:35:30.155592Z"},"links":{"cited_paper":"/paper/2511.03092","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:e4bc950e09b500ded6d4b12eabfd876734f109efc0e6bca229ee57ba545a6d5b","observation_id":"4c854c8c-7cdc-44e2-b359-5affd33eaa5c","resolution":{"observed_at":"2026-05-13T07:37:29.371449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"cited_work":{"arxiv_id":"2511.03092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.03092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","venue":"cs.AI","work_id":"d1525fbc-067e-4db8-8885-041773f05c2c","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T16:41:30.021302Z"},"links":{"cited_paper":"/paper/2511.03092","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:268fdf91fb21d6df418451e09da4f6e97cba314c077369f9d9305d42457d1015","observation_id":"fc5f6aa2-7d31-433c-a715-078373a41401","resolution":{"observed_at":"2026-05-19T16:42:39.698754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.03092/citation-record","integrity":"/paper/2511.03092/integrity","json":"/paper/2511.03092/citation-record.json","paper":"/paper/2511.03092"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":"2308.16369","doi":"10.48550/arxiv.2308.16369","metadata_source":"pith","pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","venue":"cs.LG","work_id":"3dbdd757-ca01-436f-acfd-12ffcd6f64c6","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:068832b7a1ed243ec84a4bd96132738c9833bfe072e66356b5fd8f91308e6800","observation_id":"99981bc5-d0a4-49de-a7c1-f551b1b376a8","resolution":{"observed_at":"2026-05-18T02:00:39.372114Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:3e8492437e8127d36c00e44b85a4526081fb7aa6917e788b77584554c6aa7a23","observation_id":"d52dde91-7d46-4ab9-9939-5fd516255bac","resolution":{"observed_at":"2026-05-18T02:00:39.419974Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:c78146282dcfdfed4526977ccdba3cf9fe1bd9abae78f22d4f21a933040aef1c","observation_id":"65fa7184-6bdb-4b0e-b740-c716fab62ecf","resolution":{"observed_at":"2026-05-18T02:00:39.367043Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":"2501.00663","doi":"10.1016/j.est.2015.06.001","metadata_source":"pith","pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Titans: Learning to Memorize at Test Time","venue":"cs.LG","work_id":"fb2b7625-b733-43cb-af52-00b0a31a8d7f","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:db862e494b58ea8bebf267436c2ff64b8d01a43a52b3cbf3269460f6010923f9","observation_id":"8059ce83-f165-464a-a6e8-afa35de30d8a","resolution":{"observed_at":"2026-05-18T02:00:39.426911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:d3e67ba9faad7faae0ed562cb2b0159daa47dbbad9ea7cc8a53fab983af18504","observation_id":"6f074476-8bfb-4f69-a980-94e902b0d96c","resolution":{"observed_at":"2026-05-18T02:00:39.362089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:3fcda268f0637c8624bff980aabfc7c65291393a2d977f0c833030b15ab6e115","observation_id":"eaeb9162-6276-4cb3-83bc-47e6f87bd4d4","resolution":{"observed_at":"2026-05-18T02:00:39.317879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":"2205.14135","doi":"10.48550/arxiv.2205.14135","metadata_source":"pith","pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":"cs.LG","work_id":"efa96825-0830-4cfc-a250-fdaf6af302ab","year":2022},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:444996658a1d2203a4a0a0a851b23c435b28b6a4e54c9a4459e75ae7fc59753c","observation_id":"be0f46fd-d8bc-4789-910d-e1efccc5c45f","resolution":{"observed_at":"2026-05-18T02:00:39.344554Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:312750b94cd5c265ce840b12f9233ce213ec4008fe85986e6e3d2aa5e4d18dc6","observation_id":"7ec75e2a-6e6f-4574-9ee9-7cb701263abb","resolution":{"observed_at":"2026-05-18T02:00:39.357328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-10T09:21:59.278086Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"cited_work":{"arxiv_id":"2506.06266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06266","snapshot_observed_at":"2026-07-10T16:57:24.582986Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","venue":"cs.CL","work_id":"ed7aa0bf-4cad-4890-b586-b0539e1aadf7","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2506.06266","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:6723d4b1f893f291426b93bb8185545eea652b5190f92377889641a02374db50","observation_id":"9e6914be-a189-47f1-abbe-1c3ef59c6370","resolution":{"observed_at":"2026-05-18T02:00:39.432146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:e90ee94a9dfab723bebc5294a7ecce03beb2d9447996fbfe11b30db80a1f9adf","observation_id":"2ce07502-b386-4659-abfc-e70360970fe4","resolution":{"observed_at":"2026-05-18T02:00:39.340093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:9d62f6ec6c22fc9308e5d9d1d1e56a9de9676a6073c83a4a58bd203c63fde88b","observation_id":"4ad8e13b-fbb1-4987-90f5-f33cad7e6545","resolution":{"observed_at":"2026-05-18T02:00:39.322244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:7480c68665b296bc0cc29e04df5a6c7dae5a5b8492b4fb64bb144ac571f9d7cd","observation_id":"368adab0-7116-4192-880e-f38329d7758e","resolution":{"observed_at":"2026-05-18T02:00:39.313481Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:f6846252edc61116b4dd05ad92190ac8eb3dd45de30a1d03b25e4d31f6a97cae","observation_id":"17671d48-a744-4796-a3d8-e32581783177","resolution":{"observed_at":"2026-05-18T02:00:39.348262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:72a8b0180872919774cbe38b263f45064c298b1732968fb0bceec4a8a48b10a1","observation_id":"f76bc791-9b01-41e9-a8b3-5726bb1c4118","resolution":{"observed_at":"2026-05-18T02:00:39.352517Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":"2404.14469","doi":"10.48550/arxiv.2404.14469","metadata_source":"pith","pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","venue":"cs.CL","work_id":"4afe6cb0-dba4-42b6-b553-e685e5730d61","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:a95125a4cff17abf8d3591f617b830cb1cb8c0073255e4fac14187b1088b4d5b","observation_id":"433183e5-5817-468f-a0d6-d6e3d241614c","resolution":{"observed_at":"2026-05-18T02:00:39.335562Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:27.134462+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:27.134462+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/mm","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Choquette","venue":null,"work_id":"58075dfd-7ad9-4f34-97c0-a67ff3c89e38","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:e039c48fb0f48837acbb88c1092cbcb747aac043a8dfe89b1ac1e1a19cbead1b","observation_id":"cf40428b-2d64-406e-8887-ca66295ecf4c","resolution":{"observed_at":"2026-05-18T02:00:38.288794Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:537fed4a609c260a986e8674f3ee1ae972763d66a9ebd19b8d3451dca3d3ebb4","observation_id":"4c354e2d-1044-45a5-9da8-613e0b707664","resolution":{"observed_at":"2026-05-18T02:00:39.303801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1935.2024","doi":"10.1109/hcs61935.2024.10664673","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1109/HCS61935.2024.10664717","venue":null,"work_id":"e963fe30-8a02-4eb3-bf90-0fa9cc9bacff","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:f7d37f771e7e7b00e55daa16f697135b0df6375d37dcc02dd082dfa8fded6b00","observation_id":"6b7ab900-8ee3-4313-bfcd-d1420eb90ad0","resolution":{"observed_at":"2026-05-18T02:00:38.284771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1859.2024","doi":"10.1109/micro61859.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tacos: Topology-aware collective algorithm synthesizer for distributed machine learning","venue":null,"work_id":"ec8e53fa-7797-499d-8abf-b570cbd7d680","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:6996498c6b9dda454806a53025609418dc28dd03eedef2680ac710d5586a382b","observation_id":"1a225cb9-ab8e-4e76-b080-baf954915d29","resolution":{"observed_at":"2026-05-18T02:00:38.293875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:3f00b752ff00e6414350e4b1938d5e79c9406b57352ea2228d1e909a887b47a1","observation_id":"e09c8e9c-8d95-48f7-ae73-7bea46641f32","resolution":{"observed_at":"2026-05-18T02:00:39.330829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2406.10774","doi":"10.48550/arxiv.2406.10774","metadata_source":"pith","pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":"cs.CL","work_id":"2cad64c9-e2d5-42b6-8db9-03fafde4bcb0","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:138888c240c0755a8fcd4252f23bf7d145729dc4b2deac323d63c372be738418","observation_id":"670d5b0e-c687-4816-846f-635f0eb31712","resolution":{"observed_at":"2026-05-18T02:00:39.384869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:3ec42688a89445a6503026ad0d548f0a0e71a7a875a93d00d75ce5dcd79709bf","observation_id":"0a7c5652-c170-428a-b664-b3fd6c392469","resolution":{"observed_at":"2026-05-18T02:00:39.414791Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08879","last_updated":"2025-03-11T20:45:02Z","snapshot_observed_at":"2026-08-11T02:55:45.516067Z","submitted_at":"2025-03-11T20:45:02Z","title":"LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference","version":1},"cited_work":{"arxiv_id":"2503.08879","doi":"10.48550/arxiv.2503.08879","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08879","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q., and Zhou, D","venue":"ArXiv.org","work_id":"e12f679e-9f5f-4fd4-9160-306a9bb2d556","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2503.08879","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:290d3c337f73d410c28b90a11bf98cac1e8ab17b0b63761f6afc047724a5da17","observation_id":"04bf6933-e0ac-46ce-b63b-f50462c50b30","resolution":{"observed_at":"2026-05-18T02:00:39.392292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:09.968526+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:09.968526+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:f3efb89ee7213dad85d5ee3a3213edcdd72d40d178bcccdeb789a1b3665b919c","observation_id":"d937a816-845c-44f6-91b9-81f4d3b09708","resolution":{"observed_at":"2026-05-18T02:00:39.403509Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:0f89253a696d9c587c1b1744db23269ba2a99dd128b098693aa60c352b43a403","observation_id":"42a42cee-404a-4b8d-8863-7a5cea8b9f22","resolution":{"observed_at":"2026-05-18T02:00:39.326713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":"2502.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-07-10T01:36:44.142264Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","venue":"cs.CL","work_id":"c74d35ec-94d3-48f5-a291-20cfad7c04a3","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:929dc82126701d8e53dc90ea5ee617f38cb740560f34119fd78b50ae6670a445","observation_id":"340b09c5-e6e5-4fd1-9917-a726acd440ff","resolution":{"observed_at":"2026-05-18T02:00:39.378002Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:56.478959Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference","venue":null,"work_id":"6199672f-7a6e-41ee-9a53-dcc98d435cb6","year":2025},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:2bc012e174447dece2aa6fc1306d1903ac43ceaeb2ae89adaf28de4e0e5f1c7c","observation_id":"eedf346a-1ea6-457e-9850-f9559659ba58","resolution":{"observed_at":"2026-05-18T02:00:39.410021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-02T23:59:10.592798Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":"2402.13718","doi":"10.48550/arxiv.2402.13718","metadata_source":"pith","pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"∞-bench: Extending long context evaluation beyond 100k tokens","venue":"cs.CL","work_id":"1920d14f-6a8c-4b95-b765-32b6de15ebdd","year":2024},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:ca720a8781e81574becb37503c46820d1b2d44bf15cf6e4d7d2afbc0dad1f0b9","observation_id":"0b58d72a-6099-4f09-991f-47c904079b56","resolution":{"observed_at":"2026-05-18T02:00:39.299754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:4a88756b2fc84d2e127b0f582d860b0471b9436485d3efc26b67f48472cf2125","observation_id":"460379ee-66f2-47ce-81a0-e9e4a38deb76","resolution":{"observed_at":"2026-05-18T02:00:39.309134Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:397c7064dfad9085ce6617ba35b179a09a04679ea3e4616a5ebc71d066ddcd72","observation_id":"a713be5b-4cec-48fd-b760-e990a3df4b86","resolution":{"observed_at":"2026-05-18T02:00:39.397829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","latest_version":6,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":20,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 4 inbound Pith citation observations for arXiv:2511.03092."}