{"as_of":"2026-08-08T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf93a535fbf1afadf20035f61ef57dd0b961b2cdb5b645af11f533b942647f59","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T08:09:44.957032Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02640/citation-record","integrity":"/paper/2607.02640/integrity","json":"/paper/2607.02640/citation-record.json","paper":"/paper/2607.02640"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Gulavani, Alexey Tumanov, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:1958e53584243c1085ffa7416b56a414fe2b33ab2dcc93f87fef7151015598ed","observation_id":"7913e061-c235-49ec-a95c-d165f5445ffa","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:1f68fc493945e306b5d941f7f5d0046fcbf885c1e1f2707351f745b29daa4039","observation_id":"1d694c90-0c10-4a9b-a911-4c83cad768ef","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:b9b48bb6eda0f800536f759e049997e8daca050e42a156bbd53cf5961c977b08","observation_id":"caa99582-b910-437d-8549-33eace90fac1","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"AudioLM : a language modeling approach to audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:aeda280b98af81759cc4ce97a039c2323580b24147102ecbfcfce124f6c638f3","observation_id":"792b9d43-268f-415e-8a09-e3719e02c30c","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:2da3e9b56a55f16a79f2cf29c1884f9f1a0116dd49e7ff71db88e7561ea92049","observation_id":"0391e201-4bab-4d93-9251-afcf6f49c652","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Analysis of the increase and decrease algorithms for congestion avoidance in computer networks","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:7e77ffacfccb1e63350b90673e7770fe9930e4e088f462f13ca2327f165a2b21","observation_id":"3156e588-8371-4414-acee-72c9438c2c2e","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Qwen2-Audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:3d66c88a5be1e4c9106d7458f536ec15e6063dfe2f5b73e2c3af014eac6a495a","observation_id":"d724d734-3542-47e8-aaf1-cd04c399785a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Franklin, Joseph E","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:8d1dd941e5e5132bcaab6289849867973e5e6267a46d439d5c45f5dd85fd2d1d","observation_id":"8fc8e5dc-7d2f-42f3-8bea-81f1b1c3eed6","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:70e929ac0e43224f94f04819c399a6d6c9c30c0665459042729b42c4c0d73324","observation_id":"95b4d03c-cd20-4041-96b2-d22394729d2d","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"FlashAttention-2 : Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:8b39f79e629524381ec333ac30d9236cd6881ad8459dcafe038db66df1ea6b34","observation_id":"e6e70c58-2ffe-4c1f-90ef-40aaa8558757","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\'e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:3ef1a8bd6c67c993d48dade812ddfb1f0e6218a8ee82aa25f33a2277a5534216","observation_id":"b0349e6a-0555-486c-8fe0-cf3fdbedeca9","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:d7a119df0a9a0da089e6715c76f6c2c6f4dbfaf369cfd92111d995862f06a542","observation_id":"2a57c4cb-18ea-47b3-b2a7-737322563186","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:955a3ae725b5b6538c7e88f21a5917afce5170a8eb22e196b30803ed2c10b906","observation_id":"38e28530-7865-46d3-9de8-6793765aaf2a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"LLaMA-Omni : Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:f328e08f2d38bb0c42e349cfe6dbc2a6cd7eaf5999eeab274c9570383f83c4eb","observation_id":"6199ec6f-8f95-4bcb-a4d8-b464e14d29db","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Serving DNNs like Clockwork : Performance predictability from the bottom up","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:2c912f342705cff063a4f89df79c0d1059669b9f36960bcfcc398a91ab14aeeb","observation_id":"1626593a-ef9f-41e5-b1d4-2521593cda07","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Congestion avoidance and control","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:b648bd5e2d940f4a3a77eb92e9f12ad897888eb93a523e8a03b0807ce057ca1a","observation_id":"e712c485-e049-488f-b0b4-d51ccb89f2d2","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Jiang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:963a2853947760fc8d84352c73e15a28c33d5ad076683bc27c04596c78c46abd","observation_id":"20ec07b3-0f69-4411-a72e-482402927a55","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Efficient memory management for large language model serving with PagedAttention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:4eafd92e57e77259b9ff0e0fed44b4366cd3f1bd3c44c99dc4e9b5c36e740921","observation_id":"d04d73b3-d5ae-49a0-8fb4-76c82a3a8e0b","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"SnapKV : LLM knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:ae39fbfc0e5a79cc99e2d66bd175ca7df29034829b66ec874826118ffefe35f1","observation_id":"79161ba7-16b2-41b2-8c9a-ee70a4163f74","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"AlpaServe : Statistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:1d314b695042335a1575602b4ef196fc932e1beb44d83ce1f2f22711c381a6bf","observation_id":"c59aa936-4a92-4502-95e7-90a772e5b03a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":null,"venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:da76c87d49cf8edc3e14b8028e5ff7b136b75ecd30c7de8d4edfad5413b71799","observation_id":"b8f498e0-88a6-48fa-8de5-e13712cdf3f2","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for LLM KV cache compression at test time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:63b8cd8ae308cb49255d399f4d2c07c5f21eccbf0483bebe4afcb1162b12c189","observation_id":"10693e2b-7197-42d1-b116-d5d2eff3dae6","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"KIVI : A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:58dfe014292519d2d94050101993f7c495ce7cb039f55a667aebfab35a9caa2b","observation_id":"ec53f533-d97c-4e4f-8954-5390443ac5a0","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"MiniCPM-o 4.5: Towards real-time full-duplex omni-modal interaction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:0048dfc954185d2aab1bb85932e8b95b7231f028b6da745dc4643afe5faf6e0b","observation_id":"3030f376-a360-4da2-9570-cf1ac3261d7a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:da682a058523f30b30cfc1e82140ad8a337901b612a5148ce0e342ca0b432661","observation_id":"442a61c1-6515-4493-93d1-81e57c937a0e","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Pine AI : The most natural human-computer interface is your voice","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:91c75574a1a7251f5c767295b936f61fab5d3cf0cba7cfc400b48ea4692e2596","observation_id":"7a46b328-354d-481d-a5d2-c8f5da809c2a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Qwen3-Omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:b211a5691eb6876640bba0c47823ace2d69eb63367e5dbcbf9854a16607679d4","observation_id":"29cdf237-ab8f-4224-bf40-7f1dead3f717","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:705a464f2415b332fc4976800e6adeea5662921eac64ceb7a5f90e472d4cb036","observation_id":"ab527647-3c8f-465d-a663-117925ee79a2","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:d07b5ffb996766e01c4817c3b707f8549978cc78ebd6e70987853041e61cac12","observation_id":"14668c51-e96d-4857-a407-6c7ef837539c","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"FlexGen : High-throughput generative inference of large language models with a single GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:0914e1532354e4b52b040de521426209c5ee32b85c68c6734364ab56c58d8065","observation_id":"50d62345-6418-4ccf-a3f7-d4f1f7bf2756","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"SALMONN : Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:21f6ac6a6e15d2b3c21c2e5dd80e32ad40ddfe4fdda8957b97213ad0ed74b50f","observation_id":"67b6f727-6870-44c9-b7e8-6baf1d842a3a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Interaction models: A scalable approach to human- AI collaboration","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:6424d60bdb9128b1b81c83a4067f350735238e3dde193fc742e7cb4bde0f77b8","observation_id":"ec92bf8f-d45a-4e8a-8f8f-3d59592af096","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Gomez, ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:2bf8d91cde07b54228443a1afa516b924c507626edee980c294e7e4a27367482","observation_id":"7ee98f8d-b19b-46b7-88f1-d3c53c725bff","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"vLLM v0.23: Resumable requests and the realtime API","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:092290c1e22fb457b490cd833334a72cf0baebe0373a019a0fe50d9a07363831","observation_id":"ea71684c-6268-479c-85b0-30887e9f7336","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:858b9d8153ebbb1ce1c15f65ba705430763dcec912841435b65de2f833865477","observation_id":"9f863a58-05dc-4328-aadb-78de0d1ae5ca","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:8d7cb722923db190bf96e1eb547d58d8b43fb2896b6b89e98d59ad8d0def3dc4","observation_id":"88cd8c1d-2955-4039-939a-54a02b396b34","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Mini-Omni : Language models can hear, talk while thinking in streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:3c8bf56926ca5c88b8886c103a8c914c1058790f3aef264c5952d6e9a57ea3af","observation_id":"0539b802-1920-4ecb-864f-89a4875d842f","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Qwen2.5-Omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:3616912a8c2cc0106715444b690188e5950780dec046dac5d2206f933468ecec","observation_id":"a2ad763e-62d9-4a57-b2c3-abba3e4655c1","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"FlashInfer : Efficient and customizable attention engine for LLM inference serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:eb3d2fd5f5982dfcbf21727ee19fe2d6fa675fea906847ecb29578bef77605c8","observation_id":"04baaf5c-23a6-453d-9144-222906d43bc4","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:f6f4d7fb2860284349788563027a4569a50cb58accb44bf5e846e1ed592912d7","observation_id":"2e7549eb-4052-408c-952e-be41a7ef4645","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"Big Bird : Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:e294d917ac0af720b60a730d8d3361e3dfd97fe2b782ac00e750f238d8707663","observation_id":"8789362b-f520-45a7-8901-7a5b49735e7a","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"H2O : Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:c19a2409287c8381c84bc42cd4b399294b14ba2b86980d495ebbfe818966c26d","observation_id":"113ab0dd-8066-4480-8851-c5e224c9c8db","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"SGLang : Efficient execution of structured language model programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:9fbfe8fc86b88bbcf8c2ee8c83a6251bab68fd45c66d4573bfa3c6cd2461fbf5","observation_id":"7cb5b5d8-948b-4a63-80e6-c26807a23ad1","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"DistServe : Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:8bb49af6e9f9095b78a04bb21eecd8fcf36c2a1a9066d91f4017a37ea34e20d1","observation_id":"e9af0105-998a-4824-b66c-51f86d8b97c4","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2607.02640."}