{"as_of":"2026-08-05T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4addba2bf01641a8e1dfc2559c34141b4c1c85bcbb7703873028e9ec0981ac89","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T16:58:11.105511Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T13:40:32.154860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05772","snapshot_observed_at":"2026-07-14T13:40:32.154860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10186","last_updated":"2026-07-11T08:03:13Z","snapshot_observed_at":"2026-07-16T23:18:14.147291Z","submitted_at":"2026-07-11T08:03:13Z","title":"FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T13:40:32.154860Z"},"links":{"cited_paper":"/paper/2505.05772","citing_paper":"/paper/2607.10186"},"observation_digest":"sha256:4515b444d013946d357b9270f37ce4ceadcb5b4b5648980842480987110716a3","observation_id":"e1804785-eb12-4a0c-ba86-85da2072338b","resolution":{"observed_at":"2026-07-14T13:40:32.154860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05772/citation-record","integrity":"/paper/2505.05772/integrity","json":"/paper/2505.05772/citation-record.json","paper":"/paper/2505.05772"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:5e38edc418380893498672361a2c6aadaa33aa953bfea9ca6c504e9ea1062580","observation_id":"d0a6df20-421e-413f-97cc-750445cc8415","resolution":{"observed_at":"2026-05-22T17:01:48.639275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolqa: A dataset for llm question answering with external tools","venue":null,"work_id":"8cf91773-34b7-4c22-b940-1e867ed15f01","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:e39f06d56b2e0d92ec2fdf6b05863cfedfaaccec8232d68cd84d869497a2a0b0","observation_id":"89aa74ae-03a9-4b48-a18f-00d1d7171069","resolution":{"observed_at":"2026-05-22T17:01:49.377125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pythia: Ai-assisted code completion system","venue":null,"work_id":"2d22a0b9-a7df-4447-9838-e7b6fa6c9dc4","year":2019},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:174229b6e6e8a0b97f1444530d570cec6cb81249baaef44a1b909b37eeba093c","observation_id":"4526d313-beb4-403d-8b94-36cdd01588ca","resolution":{"observed_at":"2026-05-22T17:01:49.333294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:c93d5e6998ab8abf76b2ec5d3932f55ffc65f2a6fea04429b366773d882e2ec6","observation_id":"ae8f3319-cc17-4964-b833-289d45f85d79","resolution":{"observed_at":"2026-05-22T17:01:48.631980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reflex- ion: Language agents with verbal reinforcement learning","venue":null,"work_id":"0e5dcec9-02b3-499c-9975-cc57033dbed4","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:6bab604ea2abbed4c21a7f9f42b8db5f9f10431e2c15879da09a573a68e6ddcb","observation_id":"ede85c5b-18c4-48b7-b4d7-1bb053793cc7","resolution":{"observed_at":"2026-05-22T17:01:49.363753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"f320f385-7d6c-4bff-b6d7-343e3b59a2e3","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:9b44a5a6aab6ad7dfe50bc3cdf478254a1e84554253ae60874e26d226ff6f55b","observation_id":"941d6a88-bfbf-4603-a507-4b48cca6fb0a","resolution":{"observed_at":"2026-05-22T17:01:49.346304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-trained language models for in- teractive decision-making","venue":null,"work_id":"dd89a935-2e9b-4b7d-a21a-df0f31dda9be","year":2022},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:737fd16a781f17ead7b9a783d28378f6b4fef9a80364292042de34f27e68e2d9","observation_id":"21ed6cd8-7c11-4c00-b404-172f6148547f","resolution":{"observed_at":"2026-05-22T17:01:49.337605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"749d9ee2-d419-41cb-984c-fc7295a23cd9","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:f272c9f9417ab54187538e6e4e43ddea581afb6a6c29d168d34caf67012da075","observation_id":"36049c4f-f4fe-4e17-b7c8-9ef2c856038b","resolution":{"observed_at":"2026-05-22T17:01:49.341873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"4c74cbee-8f68-4602-8b53-66748ffc4b18","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:f011e72e14bc118e016186ff054a290bdb0c18f25b177c3de76e1d2ab6902203","observation_id":"06af12f3-6f77-4e15-a146-599423b98d93","resolution":{"observed_at":"2026-05-22T17:01:49.359684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computedram: In-memory compute using off-the-shelf drams","venue":null,"work_id":"7d1bee4a-d4b1-4881-afdc-6dce2334cde7","year":2019},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:1c42ecf35406e432e64a5652dc92119d4d61499a9e2690d13da993a2ddfb2fff","observation_id":"1dfbf1f8-f989-4f41-8315-7d33ca7c7cba","resolution":{"observed_at":"2026-05-22T17:01:49.355941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Newton: A dram-maker’s accelerator-in-memory (aim) architecture for machine learning","venue":null,"work_id":"c5841301-2b11-42dc-8e8a-f2e585b77075","year":2020},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:df446e73af0279bea1af9d64317435c2f9619ccb8f5a60cfe26a4bf4200b4ed6","observation_id":"50ea3acd-516a-4b93-ac3c-d69b5d97c29b","resolution":{"observed_at":"2026-05-22T17:01:49.372596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pathfinding future pim archi- tectures by demystifying a commercial pim technology","venue":null,"work_id":"69f338fe-ef5a-4c8d-87be-231c596a55d0","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:d7868aaa04cea46295f2f05fea559b99d45e1aa5fc905d0242fc882783a0a947","observation_id":"4c465b38-8349-4d7b-8606-9697ae0f32ba","resolution":{"observed_at":"2026-05-22T17:01:49.367776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating neural network inference with processing-in-dram: from the edge to the cloud","venue":null,"work_id":"70a7c06c-fa0e-4ee2-b129-a53b1f7e3803","year":2022},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:f23915800ceafdb503d5b72542c3a540af10a632e587687ad42ec3e726a76be8","observation_id":"155f3fca-325f-482e-a0a2-1b8b0fd96582","resolution":{"observed_at":"2026-05-22T17:01:49.350627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Floatpim: In-memory acceleration of deep neural network training with high precision","venue":null,"work_id":"61f76918-76af-452d-917d-e44f8ee8e99f","year":2019},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:98ea0b042b0d84a85017894bc1b0f8a56dc6d93e841e1c20902184fa2beac81d","observation_id":"8936493c-a694-4ffc-897b-cea7b35adc62","resolution":{"observed_at":"2026-05-22T17:01:49.420304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attacc! unleashing the power of pim for batched transformer- based generative model inference","venue":null,"work_id":"9c5f0209-dbbd-462a-9d2e-94ab323dda54","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:3b26c83ec1e3df1ad439f8d9040c176f55f2667eaf3ff640a5926d81c236d289","observation_id":"1f184fd9-141a-40e2-a6e8-51bd32ed463d","resolution":{"observed_at":"2026-05-22T17:01:49.424514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neupims: Npu-pim heterogeneous acceleration for batched llm inferencing","venue":null,"work_id":"eada9880-bb40-41ea-8e49-782b934f42da","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:ecb19d5846229887cd2200de3c8d20eb33b3e815f199eca09d077217139c4cb7","observation_id":"8aa03bab-105c-47e3-99ba-d160b0985255","resolution":{"observed_at":"2026-05-22T17:01:49.436845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2406.10774","doi":"10.48550/arxiv.2406.10774","metadata_source":"pith","pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":"cs.CL","work_id":"2cad64c9-e2d5-42b6-8db9-03fafde4bcb0","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:ccccb36c94925108b55b503ae5e31e593511e138d80f5ebb031ed3074463d462","observation_id":"f93a87a1-3539-4d8d-9c0a-4b6ad83f4f0f","resolution":{"observed_at":"2026-05-22T17:01:48.552416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transpim: A memory- based acceleration via software-hardware co-design for transformer","venue":null,"work_id":"a9b3a018-1e33-4eba-b9d2-29a3266698f5","year":2022},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:42b38db734300b8cbb28d9d8d3c0382f9d6407302f4977a91c8172c5467b6e98","observation_id":"9f1d6902-e0fc-41e5-821c-492cf3bde11c","resolution":{"observed_at":"2026-05-22T17:01:49.398828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.20166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lol-pim: Long-context llm decoding with scalable dram-pim system","venue":null,"work_id":"96e3a823-f74a-4a1e-9572-25482617b18b","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:9ee39f38e27fb4d4d0aa2f7b2b872e0365dab9de75c246518a8158383579a126","observation_id":"9d007ad9-5b83-4d92-9a62-fe0cc180a204","resolution":{"observed_at":"2026-05-22T17:01:48.545822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15470","last_updated":"2025-02-27T07:03:36Z","snapshot_observed_at":"2026-07-06T20:40:30.108807Z","submitted_at":"2025-02-21T13:52:31Z","title":"PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System","version":2},"cited_work":{"arxiv_id":"2502.15470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.15470","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Papi: Exploiting dynamic parallelism in large language model decoding with a processing-in-memory-enabled computing system","venue":null,"work_id":"abf94b5b-ff8d-4fcf-820b-db6e226fb120","year":2025},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2502.15470","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:38f2b1786493bafedf0ff066f904c14e52ec45f35cdfb36ef7514b45e643c237","observation_id":"7231b18a-40a2-437d-856e-a0bcfd714dff","resolution":{"observed_at":"2026-05-22T17:01:48.594637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":"2407.08454","doi":"10.48550/arxiv.2407.08454","metadata_source":"pith","pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":"cs.CL","work_id":"37bb89e4-ffbc-414a-858a-627e6d7be94c","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:9aa1c21d94ab986a8b199dfff0183bd2555a427ba9379766fffcedbad135a4bc","observation_id":"f4275ed3-266c-4257-8746-7032d350c841","resolution":{"observed_at":"2026-05-22T17:01:48.624426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:15.401223+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:15.401223+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How long can open-source llms truly promise on context length?","venue":null,"work_id":"24ec2fb1-c1b2-4e90-860c-de6bc779cf17","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:27827af1c0c2ffa127e53216d4eb303c745d7aeb50c75d4f130aa9df04139403","observation_id":"0db3f7e9-fc34-4b3b-b4c1-d4730001bcc4","resolution":{"observed_at":"2026-05-22T17:01:49.428396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"7c3ae5f7-83ce-4c6c-b7d7-72b112bccc01","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:b89b959e27df36d407f31ac3824c75e2e51ba34086496d0b9c301a9534537ca3","observation_id":"b2af87e2-ed41-4321-8847-b2a07add210b","resolution":{"observed_at":"2026-05-22T17:01:49.403037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:8edf48a079a64037ecc06cd4a4bba443a638eee21c6409590cd2a46fa5fc2f55","observation_id":"65e06e91-dfd2-4e45-b4b2-eebe66bd1b12","resolution":{"observed_at":"2026-05-22T17:01:48.586773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-05T00:53:12.286448Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":"2105.03011","doi":"10.48550/arxiv.2105.03011","metadata_source":"arxiv_reference","pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A dataset of information-seeking questions and answers anchored in research papers","venue":"arXiv (Cornell University)","work_id":"a52f872a-7afa-4ac3-9a74-74f8fb148aa9","year":2021},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:fb81b1f2b35544061676a85b2609846901496101b2b19cc31c7203bb857c1ba0","observation_id":"9c1b9472-4040-40b8-a965-e6f115cdefa1","resolution":{"observed_at":"2026-05-22T17:01:48.612925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The narrativeqa reading comprehension challenge","venue":null,"work_id":"5f6830dc-8b03-4b32-9d3f-ad18b414d915","year":2018},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:672bf9937470252492ac3f3dff01323e48f250f0353cef401d1858495a32ce81","observation_id":"98baa4ae-bc26-4d02-919a-07e843da4097","resolution":{"observed_at":"2026-05-22T17:01:49.411447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:9da8a4935339ec54587db5f56a63e8fe33ef5fdad3b51a034215c5a09a0dc27d","observation_id":"a17e694a-e77b-45bf-b825-12561e36e8a8","resolution":{"observed_at":"2026-05-22T17:01:48.558998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-04T17:22:08.589540Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":"1911.12237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-07-03T05:17:40.236379Z","title":"Samsum corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":"13d87488-8d82-4a1a-b6ca-be21a5695dd2","year":1911},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:7300d3045656da8aa5207198cca8b3caca0a875b1763955e79a044830e7b6ccd","observation_id":"428ab48b-387a-4092-9ceb-7c96d016df93","resolution":{"observed_at":"2026-05-22T17:01:48.579348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"4e8ebb85-0f13-42dc-b910-6ff475980478","year":2020},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:dd6587915d6bbc9cbfd4f167d403cc405eca0ac6ad88fdccbce95685a5023e54","observation_id":"ae8f505c-cb96-4055-b767-1e0a55506ca2","resolution":{"observed_at":"2026-05-22T17:01:49.407532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longcoder: A long- range pre-trained language model for code completion","venue":null,"work_id":"5f049328-a8f8-4293-89bd-1ef9d70695a2","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:1d782bf2b3fbf1b6218eef80790f5c64e62520192744c0e52853efb5ffd27e76","observation_id":"7caf4020-cc34-49fc-a41a-94b14bf95d8c","resolution":{"observed_at":"2026-05-22T17:01:49.382078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":"1911.05507","doi":"10.48550/arxiv.1911.05507","metadata_source":"pith","pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressive Transformers for Long-Range Sequence Modelling","venue":"cs.LG","work_id":"70572d78-130b-4a13-908f-0702dcf423df","year":2019},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:7b465bdc00456e1eb0256d8a6811645a7f10bb927779398e1d4d20b75f820501","observation_id":"46ce69cf-37df-4b9a-b60b-22475a9d62bc","resolution":{"observed_at":"2026-05-22T17:01:48.565577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache manage- ment","venue":null,"work_id":"a8f0ef39-d86b-455b-aa96-f17231c7288f","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:580e0d1501da6816eaf4a2f7c332a01c5bb8b9c256ed7128de6f4c896640eed1","observation_id":"859f5777-a94f-4b71-b05a-95ee2b571523","resolution":{"observed_at":"2026-05-22T17:01:49.432620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":"2312.04985","doi":"10.48550/arxiv.2312.04985","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparq attention: Bandwidth-efficient llm inference","venue":"arXiv (Cornell University)","work_id":"1fa58820-f3b9-446e-9b1d-5b9ab21405a2","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:8cd4c779e3f6fa3ccbb629826e2af224c11361ca4bcb3b7c8c62cdd329154a64","observation_id":"733b74c5-244a-427c-924e-d71070f9fb19","resolution":{"observed_at":"2026-05-22T17:01:48.528269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating bandwidth-bound deep learning inference with main-memory accelerators","venue":null,"work_id":"21b675b9-32fa-43c5-84ff-51286a426d0f","year":2021},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:78a7c2f1b5a8b5770d5f8e65b3ad2927aa55824741cd57c6d0dfa53a6ce10bce","observation_id":"03cb7c30-75f8-41c3-bd49-12f3696aa48b","resolution":{"observed_at":"2026-05-22T17:01:49.391337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01994","last_updated":"2025-03-31T21:42:43Z","snapshot_observed_at":"2026-07-06T21:03:16.692742Z","submitted_at":"2025-03-31T21:42:43Z","title":"PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs","version":1},"cited_work":{"arxiv_id":"2504.01994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01994","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pim-llm: A high-throughput hybrid pim architecture for 1-bit llms","venue":null,"work_id":"7d6728b4-494a-4068-8c35-244e2d9da58f","year":2025},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2504.01994","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:8a47d68fd2b65b32be85a884a3a1c310aedcaf1e2933936ac3737f9ce79975cf","observation_id":"16d14693-4eb8-49f9-9238-c7d78dd72f95","resolution":{"observed_at":"2026-05-22T17:01:48.603458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make llm inference affordable to everyone: Augmenting gpu memory with ndp-dimm","venue":null,"work_id":"4344ebcd-f190-48ea-967a-742aec867757","year":2025},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:2095237a5a04411ef06628b1829218a01f06931a3d11af0dada570d2c9d40fae","observation_id":"a0793e62-3d74-4805-8c09-a6a6691cc991","resolution":{"observed_at":"2026-05-22T17:01:49.386567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"bee8e23f-300b-4530-8493-5b8ff894ce26","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:11300bf14e4cbf32ae3a16da89a43d0a2186e87c58eb0e8a082caaf6eb023563","observation_id":"5db33249-cd19-4fec-901e-8d790f2eb251","resolution":{"observed_at":"2026-05-22T17:01:49.415931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"26784501-376e-4807-98f7-7a8540614a0f","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:1502f16ca191f057ddd2a43eaf8348b2008cd103219e68ce1b56c5662ad8417c","observation_id":"b08d30b4-d613-41cc-bb3d-92167b9d2c20","resolution":{"observed_at":"2026-05-22T17:01:49.441191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:326e6e40d7c82d3afd702fbc1c34ddef29d5d0e9566620a4257924c9c433a88a","observation_id":"53d99a0a-a4df-4861-b32c-47134b63434a","resolution":{"observed_at":"2026-05-22T17:01:48.534979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03213","last_updated":"2025-06-14T06:17:33Z","snapshot_observed_at":"2026-07-06T20:01:27.728631Z","submitted_at":"2024-12-04T10:58:27Z","title":"ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression","version":2},"cited_work":{"arxiv_id":"2412.03213","doi":"10.48550/arxiv.2412.03213","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Clusterkv: Manipulating LLM KV cache in semantic space for recallable compression","venue":"arXiv (Cornell University)","work_id":"a9a2d115-42e6-4cad-8332-1533a18c30ec","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"cited_paper":"/paper/2412.03213","citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:fb7803840251235c7ee1be9a4e501bc12583ed0e6ea6277d733686d1b8630fdf","observation_id":"5c6b3ef3-574f-4e08-ad45-4712437638d1","resolution":{"observed_at":"2026-05-22T17:01:48.520894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:27.93325+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:27.93325+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.09688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:03:41.204352Z","title":"Squeezed attention: Accelerat- ing long context length llm inference","venue":null,"work_id":"6b14fab6-f5a0-4749-8cd3-f08492e7192f","year":2024},"citing_paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T16:58:11.105511Z"},"links":{"citing_paper":"/paper/2505.05772"},"observation_digest":"sha256:36483ead5b3a343dcb88ef263b714f9de7937e31071aa4105efa8d4200670b45","observation_id":"a98d89ab-9a03-43c4-a630-94002f6745c8","resolution":{"observed_at":"2026-05-22T17:01:48.618802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05772","last_updated":"2026-05-12T05:15:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T02:21:02.338710Z","submitted_at":"2025-05-09T04:17:05Z","title":"Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":25},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.05772."}