{"as_of":"2026-08-21T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:767f8bcdcaa653af457f21defc5c926704c0e2a18cb6be4779912cdfe02ed987","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:26:58.841866Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:55:55.168098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20102","snapshot_observed_at":"2026-08-01T02:55:55.168098Z","title":"arXiv preprint arXiv:2511.20102 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-08-07T08:55:53Z","snapshot_observed_at":"2026-08-18T07:58:22.024880Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:55.168098Z"},"links":{"cited_paper":"/paper/2511.20102","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:a27088eeb9e2c5386e58de17473ce8d6d4e72739ca679228dfd96afc9962df58","observation_id":"8ad8611a-7984-4426-b3e8-ef3e1b5ac2bc","resolution":{"observed_at":"2026-08-01T02:55:55.168098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.20102/citation-record","integrity":"/paper/2511.20102/integrity","json":"/paper/2511.20102/citation-record.json","paper":"/paper/2511.20102"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.729402Z","title":"RepoCoder: Repository-level code completion through iterative retrieval and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.729402Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:9bd29a0989a8a5ed10d4edd9812f371bd0420eb6370c379c0e5be6ea806bf5f0","observation_id":"2a356653-4ea8-4e1b-a107-deca93b04064","resolution":{"observed_at":"2026-08-03T20:26:58.729402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.733410Z","title":"SWE-bench: Can language models resolve real-world github issues? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.733410Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:74bfe8432a0b1ed24ce07aac4badd2f3770935f7e8aa7b91c50a3d38a5576cbd","observation_id":"51e73469-61e7-4e73-8154-10c059e3cb70","resolution":{"observed_at":"2026-08-03T20:26:58.733410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T20:26:58.736622Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.736622Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:3e5c930bfc09efff84c795ca509190c8d85b5f55b4aa315e1a724ac49905e458","observation_id":"a359517d-e8fe-49c5-b6dc-7cf31dcf5dd3","resolution":{"observed_at":"2026-08-03T20:26:58.736622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T20:26:58.740340Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.740340Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:34ac969154f32c6c42ff8eebe27ff33b322dea6ce5ecab1e67bee7bedfa4b60d","observation_id":"cfec3f38-2d17-445f-88db-b67548091657","resolution":{"observed_at":"2026-08-03T20:26:58.740340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.743422Z","title":"DeepResearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.743422Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:3c505364f14f3656b22b1d8495ba631c2baf4e94ec7aeff80da918a18e4e0985","observation_id":"93ae988c-d204-4e76-8d44-92f483953e53","resolution":{"observed_at":"2026-08-03T20:26:58.743422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-03T20:26:58.746500Z","title":"Qwen2.5-1m technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.746500Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:88ec190776390049ce4a39b5cceb9c47eec85022d7d0b3ec63272fb57aaf6338","observation_id":"c23ae301-0286-43d0-98de-a0abe18a4c88","resolution":{"observed_at":"2026-08-03T20:26:58.746500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.750088Z","title":"Efficient attention mechanisms for large language models: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.750088Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:2ccad5d97cf5ae04165a48f49c2c44483d42fbe0a126d8b10d5e0a82e6e58e30","observation_id":"4378f1c6-97d9-46ba-89de-016d8a5aae22","resolution":{"observed_at":"2026-08-03T20:26:58.750088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.752937Z","title":"InfLLM: Training-free long-context extrapolation for LLMs with an efficient context memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.752937Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:3d5b25a3335ff3f5eb8a868152b9b065a09f9bc5444d6138d0e6642a49e34a26","observation_id":"a4978751-50b7-4bae-b1ff-a57c17ba0049","resolution":{"observed_at":"2026-08-03T20:26:58.752937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.755690Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.755690Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:0f4c8b48c9aa7f3ed0866fc518df89fdda6ba9c20d9c3d0273942ec4914aaab1","observation_id":"fc1ec184-7f2e-44bc-9dbd-40d71ecb1d68","resolution":{"observed_at":"2026-08-03T20:26:58.755690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.758559Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.758559Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:439772597a0a356d0553b8c6bb0ca6e3d83544fceffeba3667ecfa75d8a9069e","observation_id":"9f842d74-6e69-4460-ae91-d6c3290f0e49","resolution":{"observed_at":"2026-08-03T20:26:58.758559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.761292Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.761292Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:dd26e58b6e16e89c974dd55074baa28623aee7253e74e84573961a864fe1cf00","observation_id":"0ba24532-4334-4096-a549-310755b3a7a6","resolution":{"observed_at":"2026-08-03T20:26:58.761292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.764159Z","title":"MoBA: Mixture of block attention for long-context LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.764159Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:1891f478a8b19065015bdc1c59319878f6ec94f55bb05a620172d7d152ac8542","observation_id":"b6471f1e-407f-4319-97ba-bc373cdd48ae","resolution":{"observed_at":"2026-08-03T20:26:58.764159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-03T20:26:58.767079Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.767079Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:e8dea095a787951b8a499e86d0432b9dd1081cd780c31c523a2ebde4bdc1432d","observation_id":"bd7dc74a-1242-4fe0-857c-5dbcd6c16cc0","resolution":{"observed_at":"2026-08-03T20:26:58.767079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-03T20:26:58.770120Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.770120Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:f7a828d037e1412871802a293cddf761921c037bd63b41c677ada87230df3587","observation_id":"cb55ba6f-abab-4106-a3a9-4c5939cacc30","resolution":{"observed_at":"2026-08-03T20:26:58.770120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.773102Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.773102Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:91c369a29e557af4f5d17aa148145833aae33d844e12605e304cc9e204c989e0","observation_id":"70ece932-7827-4032-ad23-bd9a32b71982","resolution":{"observed_at":"2026-08-03T20:26:58.773102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.776015Z","title":"XAttention: Block sparse attention with antidiagonal scoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.776015Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:8e1934cefb4da2ab4efe84cc1750e3c29adee0c28f392bde67b01c1b550b6112","observation_id":"c69861b1-2179-4760-8eaf-42ed8d239f7a","resolution":{"observed_at":"2026-08-03T20:26:58.776015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.778802Z","title":"Quest: Query- aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.778802Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:b86cc7ddca9548713013cd5b5b66a01b13d9856e7206aca65b79059d860b4cd0","observation_id":"aa396816-1a8b-4ea2-8b8e-59f291aa802d","resolution":{"observed_at":"2026-08-03T20:26:58.778802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.781744Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.781744Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:a326ad55f74ac83e52d9b3ff4d2b9474612b3b3ad892a1128d6973e5a93c3e35","observation_id":"468b92de-4e2b-4c33-8ac4-e46054bc859b","resolution":{"observed_at":"2026-08-03T20:26:58.781744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.784475Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.784475Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:9f3474d013bdb39b44fecbb366e9db6cbca5710e3bcf38a3dac1008451305de8","observation_id":"978f0d5d-f254-40f8-ac1e-6b73528c029b","resolution":{"observed_at":"2026-08-03T20:26:58.784475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.787691Z","title":"Infllm-v2: Dense-sparse switchable attention for seamless short-to-long adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.787691Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:d0650c8dbce67df8c192eed304e6f95ebb188c1b5aca919688ce26b29a98671d","observation_id":"185cfc53-2405-41ba-b190-71e690cbda3b","resolution":{"observed_at":"2026-08-03T20:26:58.787691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.790545Z","title":"Deepseek-v3.2-exp: Boosting long-context efficiency with deepseek sparse attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.790545Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:1d82b1087493f096013f5991e1aeeddf3cd8ce51d07dc298209dacddab2b38b2","observation_id":"1f39bbbf-ee7d-4fbc-a758-93adb4117053","resolution":{"observed_at":"2026-08-03T20:26:58.790545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.793340Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.793340Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:8e3557181eed3eef7dcbbedc7b7fb4c176b88dab6d97a7efcfce32988aae98f2","observation_id":"343d7faa-8490-49bb-9f08-55ebaa653f43","resolution":{"observed_at":"2026-08-03T20:26:58.793340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.796018Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.796018Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:afe54b519d632ff472efaf0a26627a1da2f987bd10404a63ef937cee50d63f54","observation_id":"14344ca0-4f15-4f08-bbd9-ad9936181a0a","resolution":{"observed_at":"2026-08-03T20:26:58.796018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-16T10:49:25.957908Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-03T20:26:58.798692Z","title":"Fast r-cnn, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.798692Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:a1ef9031a9db3f1eb4fa89e05fe89bad30a52c43bd3d4862af9a9ea7838ac586","observation_id":"312e74e3-1f68-4acf-a347-dbd0c204bdf3","resolution":{"observed_at":"2026-08-03T20:26:58.798692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.802026Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.802026Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:8632e2aa20536ccad20ab3d8c83124ab9574c72062e41ead17b47f670554e33c","observation_id":"1badb153-3a0a-4ec1-8e95-8cb7864e031e","resolution":{"observed_at":"2026-08-03T20:26:58.802026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T20:26:58.804694Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.804694Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:2c4ea1dc1308a5f00229f70fee4ce3af5199ab8cc394d0c40ac6748b4459255f","observation_id":"afdb395c-767f-4c3a-bb79-6fe0657abf8c","resolution":{"observed_at":"2026-08-03T20:26:58.804694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.807531Z","title":"SmolLM2: When smol goes big — data-centric training of a fully open small language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.807531Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:bdb3d47e4a6b50072a096f9a93ce468d0e2629b1668002e04189ff2e833319e4","observation_id":"d21ea959-c08b-4e19-8e01-fd44a2d547cc","resolution":{"observed_at":"2026-08-03T20:26:58.807531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.810627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.810627Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:fda0078be6206ac09b859b5cc04fa28d63767ad86289ba73e8f7b1f77331b509","observation_id":"64fa50e5-efc8-44ec-acc1-c555546edad3","resolution":{"observed_at":"2026-08-03T20:26:58.810627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-03T20:26:58.813566Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.813566Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:767061cee596a647abcd1f301872a7f2e6def30eb4abb0834a0ef48617aecbac","observation_id":"041fc075-58e6-4f1c-a1b2-07adaed3c53b","resolution":{"observed_at":"2026-08-03T20:26:58.813566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.816575Z","title":"HellaSwag: Can a machine really finish your sentence? InProceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.816575Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:8d5b982d9c9f11bf5d2d3a9baaf6cc0a2b05cad0d2a2047c4a6f33a4c9ec79e6","observation_id":"69759f69-382a-4a95-8de2-df1234edce60","resolution":{"observed_at":"2026-08-03T20:26:58.816575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T20:26:58.819420Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.819420Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:e208c636ac01aa29c032d43ef40ccbde0fc140639283d45c4fac8e9e40243cf3","observation_id":"e28ee209-c4fb-4255-a529-ab3ddb0ca3e6","resolution":{"observed_at":"2026-08-03T20:26:58.819420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.822433Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.822433Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:e4602a261a76a2da50c6e0afb5c3d00e0baead7c5d8438684895c102ef6fa438","observation_id":"7e76a162-02ee-4d87-bd99-9e2cf59417b6","resolution":{"observed_at":"2026-08-03T20:26:58.822433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.825242Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.825242Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:12e3b77929274c77edab0c5b1c9cb73c31b5634658a564f274e80d8bc3da1c1f","observation_id":"cb07d4e4-d60f-4c62-9ea2-d9da5a91b540","resolution":{"observed_at":"2026-08-03T20:26:58.825242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.827903Z","title":"RULER: What’s the real context size of your long-context language models? InFirst Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.827903Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:66d5994d99c400d6041e46c1fed99de3ebbb2aff1deef2982cc9364f84bd10d8","observation_id":"318f6f40-9ec1-445c-a24d-0f9b837a426c","resolution":{"observed_at":"2026-08-03T20:26:58.827903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.830546Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.830546Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:d9d9bab102ffbf4cc17585a7767f763a6a8caf5c10aec59efb16d6ce6405a317","observation_id":"8366c321-7f2b-42cc-835e-168c3340e697","resolution":{"observed_at":"2026-08-03T20:26:58.830546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.833629Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.833629Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:1d3f2d101112949a4ab0f85e5ad590e9d83400e66e849954143ab6abb7918c81","observation_id":"5fd507f8-a7bb-4933-ac4f-15bf8d910da7","resolution":{"observed_at":"2026-08-03T20:26:58.833629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.836516Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.836516Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:8f9dbe2f3dab5465cef7204fd68c3a0aef04cdc22b9696458cf8bdee6ea41a3c","observation_id":"279b0f14-75d0-4847-8963-146fcfcac2ba","resolution":{"observed_at":"2026-08-03T20:26:58.836516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.839161Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.839161Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:f64719f04d55961346cf04ae007ee6a0c4f414db6734db1df1ec052eeb787e74","observation_id":"9fc96259-379a-4c22-9238-f5d598e04f9d","resolution":{"observed_at":"2026-08-03T20:26:58.839161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:26:58.841866Z","title":"Liger-kernel: Efficient triton kernels for LLM training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:26:58.841866Z"},"links":{"citing_paper":"/paper/2511.20102"},"observation_digest":"sha256:6420370c9a1ea197e1c5737e0d56cbc29a72847c5c6fc875331385da4349e4ee","observation_id":"a62a12fa-367a-4f29-9af5-0eab09a17b81","resolution":{"observed_at":"2026-08-03T20:26:58.841866Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T12:26:02.765859Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2511.20102."}