{"as_of":"2026-08-13T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c31870c08d45fcf699b5ecbc26e5b675af1b082082950aa547f55adf8cd60c5","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:45:03.532943Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.10944/citation-record","integrity":"/paper/2606.10944/integrity","json":"/paper/2606.10944/citation-record.json","paper":"/paper/2606.10944"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Discrepancy minimization via a self-balancing walk","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:37df10417e0f3b2ec6f00e37e46a6b93682c91221fb809e1a48e4a76351aff3e","observation_id":"e45b77b4-03e2-4b8c-ab8d-f6c7463dadae","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:0fe27a229feedbbebf47e6be2f25a22154514550b292c51e0d478df79781857c","observation_id":"90d19da5-8dab-4241-8866-ef81dbba9b6d","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:d24e24939d5279c54bb90c3ee000453a9d8658f82cdc9da11d8aa240b3b3205b","observation_id":"574fdf05-9b2b-4e0d-ba62-91c6a94a6c42","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Low-rank thinning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:c82871b228e9f2a2ad9953d8253c090a6625b2e73f0371098ebd3d081d85e27e","observation_id":"75a421c0-d9aa-4db1-aec8-fe3f577b5edc","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"On linear-time deterministic algorithms for optimization problems in fixed dimension.Journal of Algorithms, 21(3):579–597, 1996.(Cited on page 6.)","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:9eb1b41539828bc987eb8cb0256e49da8824ec0829a8214fa7833b0376fec3d8","observation_id":"f87c2032-c25a-43a2-8e10-5c5f426c5526","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:2b1532ff95b094cdae9fba6afe5bbc915680b517c928eb629d26de45b81a326c","observation_id":"d170db6e-a557-41b3-b621-05a5e16c4580","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in Neural Information Processing Systems, 35:16344–16359, 2022.(Cited on pages 1 and 7.)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:69fb9c72e87e380728216984445b264571b46a8d06e238d7d9bf17b0850e8a53","observation_id":"b6df60af-f0c1-41a2-9bfa-8c93ceb0362c","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"A simple and effective l_2 norm-based strategy for kv cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:5f588fb409e39e750b45479fa4c6bca69e3b8022180d94c7fdeba5fddf002a31","observation_id":"6631bd1b-eee6-492c-8e2d-fe3e9bd151ef","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00636","doi":"10.48550/arxiv.2510.00636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expected attention: KV cache compression by estimating attention from future queries distribution","venue":"arXiv (Cornell University)","work_id":"06043450-dbd9-4e7f-92b5-07811314b835","year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:e9155af7a0e29e729f3bd76fe7d4c51d80925f0366536a045af43c249bb6c5ca","observation_id":"4fd10837-4715-4802-8b4e-d7373507b068","resolution":{"observed_at":"2026-07-03T04:37:37.412042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Generalized kernel thinning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:264d83d78b581fc78a3bf9b8e8f559eafc3d93285b094031fea46ebe68c04944","observation_id":"ff88c763-4822-491d-9657-dbcf1cf37500","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Kernel thinning.Journal of Machine Learning Research, 25 (152):1–77, 2024.(Cited on pages 2, 5, and 15.)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:bb377237adbb0e404b099f09e85feaf750a2c61f49e1b261186a90c297df26fe","observation_id":"b50849c0-3f7a-4b6c-a35c-d2dfd24fdc9b","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:067383f6bd991f377460bd335317af9ccea80017d17f019305aa14028e802987","observation_id":"be0d4b06-ea92-4a0c-b8f0-8ed76287d7d9","resolution":{"observed_at":"2026-07-03T04:37:37.409067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:9b6012e72e708cba439ab39c749d1addddaf91e0c60d28df123fe15709113b7a","observation_id":"26e6f224-00b9-4392-9730-464c558ef55f","resolution":{"observed_at":"2026-07-03T04:37:37.406354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025.(Cited on pages 1 and 9.)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:8c15e84675424c68f259a42fa0bca916595dc13a7b0969b8d95fcf7c31842197","observation_id":"fc869b47-85b6-4bbf-b234-75ef37f50268","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:00ee541d9b544e4bbddf42cc39c9104a7ad64390d30a16268e67624ff82c9ccf","observation_id":"2e36604d-0b80-40e4-9a36-b9d0c56bb9c6","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:51008712a054f376710102cf338428bfa15dfe44377efb8343aec0ad950ab3c9","observation_id":"b38b8d1f-35cc-4305-8b71-863b495d682c","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2282952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.256362Z","title":"Journal of the American Statistical Association 58(301), 13–30 (1963), http://www.jstor.org/stable/2282952","venue":null,"work_id":"654080ab-0253-458f-a0c3-f70c758fa757","year":1963},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:b372c58ff1938405cf7c466f8ee813be41061e1139a165ccadd15d34882e9b5b","observation_id":"ab7385c3-d144-4291-ae8f-81a540e000bc","resolution":{"observed_at":"2026-07-03T04:37:37.400956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:e77d2f47f0f56b0cbe906e569ce40ff694c41211fc6a3230a5910ebf5300d22e","observation_id":"e07238ce-4190-437a-a2fe-258c65f78151","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Streaming attention approximation via discrepancy theory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:776e4b2ff9ea1e76f698ca0db0bf166eead9040886c0789330a8595cad3dbdb8","observation_id":"0e8b7195-f9c2-4718-bb2c-2af80daf91e3","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Learning question classifiers","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:e0995364f6762717396b580d3eaf70d6170d78e32eba3b827e64a547c60edeb3","observation_id":"28c23660-43d4-4306-a7b8-bec65be81222","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:7382ee447d409dc5568d0ee20ce9d00a0ffe405b7aa24b3864ff703d48e56f5d","observation_id":"741255c9-5b38-4bf2-89aa-f36944de43de","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:d7b78c0bbaf930d81da85946cb563e739f8457be542e00617c545aecf57b2e2a","observation_id":"5a72d0d9-382a-4f92-b19b-8638fca72104","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Approximations and optimal geometric divide-and-conquer.Journal of Computer and System Sciences, 50(2):203–208, 1995.(Cited on page 6.)","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:b3e3259fbea60b0abd43a397542197dd4be4899608911cb80f356b56d79cf312","observation_id":"a69628d0-ba2c-4a93-8570-1aabf058825e","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Keydiff: Key similarity-based kv cache eviction for long-context llm inference in resource-constrained environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:e5b8481df24e28e886966e6a347bec34b47475802086ff105d9a43cbda03c138","observation_id":"310897b2-e984-4d9b-a45b-04d74cf7f386","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Algorithms for ε-approximations of terrains","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:59d33786319bb5afc1557b0aea74b6b35f89337930a992240b2baaa9785ae25d","observation_id":"b67fe146-a6c1-4008-b690-9c0d7c08849c","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10056","last_updated":"2026-06-01T15:36:34Z","snapshot_observed_at":"2026-08-03T01:28:12.925333Z","submitted_at":"2026-02-10T18:22:32Z","title":"WildCat: Near-Linear Attention in Theory and Practice","version":2},"cited_work":{"arxiv_id":"2602.10056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10056","snapshot_observed_at":"2026-07-03T04:37:37.402371Z","title":"Wildcat: Near-linear attention in theory and practice","venue":"cs.LG","work_id":"11f736df-df3b-4282-aaa8-e8be659d2f74","year":2026},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"cited_paper":"/paper/2602.10056","citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:50d4691fcf4c326e05e7eed41e9899c0f93a593c11a088a683c19ef965e0dca5","observation_id":"ecc4609b-70be-486e-93f2-a74c8c335331","resolution":{"observed_at":"2026-07-03T04:37:37.403754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.Advances in Neural Information Processing Systems, 37:68658–68685, 2024.(Cited on page 10.)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:c88b74407e8871bc97805c110f7f6b13bc9debef288aab6007fc48c24928cfb2","observation_id":"5d245598-5ce7-4df4-9c69-8cddaca3c15b","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Distribution compression in near-linear time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:2095767cbdcad4bb4bf05798ad8c7703aabe7f7c0e7dcdfea7d242ecb8019eb3","observation_id":"c468ca8b-542f-407f-987f-64da09d4c6c6","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Support vector machines.Wiley Interdisciplinary Reviews: Computational Statistics, 1, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:cba17034dd3762d82a5b5748ea790e4be1cceaad706ce463df71ea5e5e434a38","observation_id":"31eeb12f-9bc6-4f6c-84e0-ec692916347f","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:74c5c55d8ecc752fdd200cb840e59cf83a8a2200e8fe9a84561dca0f7a2e29c6","observation_id":"f0965485-5b58-421a-95a3-1a400cae231b","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:08430b8769d44baab4c74d6bf249e7ce04a65dc69688ccfb0afaf7d2a0fa7c74","observation_id":"0f8afbde-3fa3-4b1d-bd16-9ef5d5b08578","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:3caabfe314b7d11d09b701d27c2da756056f388cddc5b416a4056ca5b10bd365","observation_id":"1f86c3d5-5720-4641-a365-35258a731410","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:fe0dbf3debde7b8ddf2081d25e1df1355cec82b9302de0ac908dbd5c04b49793","observation_id":"9793eefd-d18b-42b5-ba10-84383a9e488b","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:d4ee2436de25619e139ff2d1152ee51fd11e1846fbe4594b2408af387ebf2ecf","observation_id":"67b817ec-bcf9-4fcb-b795-f25daffc22d0","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:45:03.532943Z","title":"Kdeformer: Accelerating transformers via kernel density estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:03.532943Z"},"links":{"citing_paper":"/paper/2606.10944"},"observation_digest":"sha256:cff46449e9b502eeba406c36354f18817259649f6d62746c4f667658a0764a42","observation_id":"29fd6e0e-b371-42bd-9fa0-77e9dfe1d1b3","resolution":{"observed_at":"2026-06-27T13:45:03.532943Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10944","last_updated":"2026-06-09T14:48:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T12:32:29.806639Z","submitted_at":"2026-06-09T14:48:56Z","title":"Express Language Modeling"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2606.10944."}