{"as_of":"2026-08-10T06:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:409a2cbe7f863e47cbc85c547602049cf867717a318058f23474ecdde8ce5464","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:02:54.529833Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23193/citation-record","integrity":"/paper/2607.23193/integrity","json":"/paper/2607.23193/citation-record.json","paper":"/paper/2607.23193"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-04T04:02:54.403845Z","title":"Token merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.403845Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:445c76fc20decba40b88d0f80d72d4ab490de6cbfe356da6117431bf8261ee19","observation_id":"321e6400-3136-4806-92de-a7d1d23f542e","resolution":{"observed_at":"2026-08-04T04:02:54.403845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.407268Z","title":"Animageisworth1/2tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.407268Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:a6c494d24275ae9a528d0f404dedf44bf2738831f4c80f5a4627d4219379a13b","observation_id":"e0f66cb5-7bf5-47f5-ba9c-fdd856498ff2","resolution":{"observed_at":"2026-08-04T04:02:54.407268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.409945Z","title":"Howfararewetogpt-4v? closingthegaptocommercialmultimodalmodelswithopen-sourcesuites.ScienceChina Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.409945Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:89846d4c0407616fa3df254688a9997e15956a1e21a6a72da4ffa61b5fe6d4d5","observation_id":"5d09a710-17d7-4815-991c-d667f60a561b","resolution":{"observed_at":"2026-08-04T04:02:54.409945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.412497Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.412497Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:7f63370c1e2512dd8ce5a1115e0f9896530774b4b64620857e6088e5d5d18af4","observation_id":"e9de0de9-3c6d-481f-834f-0342e2aa925e","resolution":{"observed_at":"2026-08-04T04:02:54.412497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-04T04:02:54.414925Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning.arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.414925Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:e967491ffbcf6422513719c4abbcde5d60f4d38fab8433ef1035cc00eda65d77","observation_id":"5ff12260-6c83-4bfa-aff2-95f38fdb89ff","resolution":{"observed_at":"2026-08-04T04:02:54.414925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04804","last_updated":"2026-05-13T17:11:48Z","snapshot_observed_at":"2026-08-09T15:22:21.165722Z","submitted_at":"2026-02-04T17:51:05Z","title":"OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04804","snapshot_observed_at":"2026-08-04T04:02:54.417708Z","title":"Omnisift: Modality-asymmetric token compression for efficient omni-modal large language models.arXiv preprint arXiv:2602.04804, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.417708Z"},"links":{"cited_paper":"/paper/2602.04804","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:8e4c7f584ff1b35bbdce3e6946a762cc3b0d70ff0f4416ead9794674b769442c","observation_id":"dbd625f2-1585-45a4-825d-d7a855029a5d","resolution":{"observed_at":"2026-08-04T04:02:54.417708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.420658Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis.Knowledge-Based Systems, 99:135–145, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.420658Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:56fd441f250c5f7eded5e37e764456ffbc21a854b0093e24cba2f0f8a4550075","observation_id":"42b3b869-dc30-467d-8c87-279cf1c3c586","resolution":{"observed_at":"2026-08-04T04:02:54.420658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.422877Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.422877Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:2366ef717c316b12e2de091c29d2696485bbf756423169239640bbec188d4031","observation_id":"4de105d5-329a-4524-a97d-03d201a4c5bc","resolution":{"observed_at":"2026-08-04T04:02:54.422877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.425121Z","title":"Video-mme: Thefirst-evercomprehensiveevaluationbenchmarkofmulti-modalllmsinvideoanalysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.425121Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:30d0498d002ec746aef00396b6fc4dcfae45308179262f3c9de2efa8ab5ac76a","observation_id":"059812d1-8ab1-4999-9197-160ea2f0323d","resolution":{"observed_at":"2026-08-04T04:02:54.425121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-04T04:02:54.427425Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.427425Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:be3e3b88eb4c47d95f3999358f6ae401f45c3434fb0abc366b9fcb6d86af5fe8","observation_id":"bfdb2d56-db0f-4f24-bc84-22ffd3c0f001","resolution":{"observed_at":"2026-08-04T04:02:54.427425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-04T04:02:54.430169Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.430169Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:d144eb21ef4a46d14fd474fff26ff909cfabd6c0a33b1192badeb268cd312710","observation_id":"fdc2347b-b2c4-413b-98e5-97eddb1c6c81","resolution":{"observed_at":"2026-08-04T04:02:54.430169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.432700Z","title":"Prunevid: Visualtokenpruningforefficientvideolargelanguagemodels","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.432700Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:3ab51c28d6f8b8457917055a146efc859719b94411d0a08b7cf899176dd6eabb","observation_id":"f5cc7892-3b71-4048-9417-80df2d7bb9ac","resolution":{"observed_at":"2026-08-04T04:02:54.432700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T04:02:54.434801Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.434801Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:3d130dad8e6b047dbd0d036433a43d02df38001826a644126838a4a7a560def7","observation_id":"9109553f-81e9-41e3-b035-1c8b65ce404d","resolution":{"observed_at":"2026-08-04T04:02:54.434801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.437064Z","title":"Efficient multimodal large language models: A survey.Visual Intelligence, 3(1):27, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.437064Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:74c26b8d93ed28f95c887d718d550d98e0ac087c49ef928547a6e852b9d56261","observation_id":"15f6d9a0-23c7-41ca-aebf-0b81797b5571","resolution":{"observed_at":"2026-08-04T04:02:54.437064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.439280Z","title":"Tokenpruninginaudiotransformers: Optimizingperformanceanddecodingpatchimportance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.439280Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:514ff8e4b548f8db60181fec448f19d8e03d1578602cb49f014a958bbfc943c0","observation_id":"3f2fadfb-0fbd-453b-b8eb-523d0aa91ac5","resolution":{"observed_at":"2026-08-04T04:02:54.439280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T04:02:54.441373Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.441373Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:e8d9e9966a8481cccd558a0aafc199e19a3480f5ac8c831155745f2f4a0bbea8","observation_id":"9abbf839-5c61-43e4-b63c-45e52ad589eb","resolution":{"observed_at":"2026-08-04T04:02:54.441373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.443570Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms.arXiv preprint arXiv:2510.10689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.443570Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:8c166771786531c67ee671218dcde9de658245ccccd8d7866374ac047cfe926c","observation_id":"a1da3b83-dd4a-4444-bab5-dd0b8794c78d","resolution":{"observed_at":"2026-08-04T04:02:54.443570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16009","last_updated":"2023-06-28T08:33:13Z","snapshot_observed_at":"2026-08-09T12:03:56.458238Z","submitted_at":"2023-06-28T08:33:13Z","title":"Accelerating Transducers through Adjacent Token Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16009","snapshot_observed_at":"2026-08-04T04:02:54.445710Z","title":"Accelerating transducers through adjacent token merging.arXiv preprint arXiv:2306.16009, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.445710Z"},"links":{"cited_paper":"/paper/2306.16009","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:75680adceeaef549a8446919303d2371001083c7b4f39e5cbff53e4dae1b9028","observation_id":"4d4a87ba-6e4e-4cfb-8dd4-4b94e61d93cd","resolution":{"observed_at":"2026-08-04T04:02:54.445710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.448375Z","title":"Video-llava: Learningunitedvisualrepresentation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.448375Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:aaad7b14b686b905f4f78204b1733ff9bd3f81335d4b0926c757fd58b26bb61a","observation_id":"84198396-a7f8-490a-8c42-3d7f356f78eb","resolution":{"observed_at":"2026-08-04T04:02:54.448375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.450552Z","title":"Speechprune: Context-awaretokenpruningforspeechinformationretrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.450552Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:5ef94f372a7592010bacaa3a8485613a7c5dc35f2b3592b9328493a3078d9376","observation_id":"3dc2ff65-e3aa-4421-a9f2-7a88e5ea5509","resolution":{"observed_at":"2026-08-04T04:02:54.450552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.452730Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.452730Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:069cfaab6440b56b2eb2a431eaa05e39a8ac4e4e8afaf80a819a7113aa465b23","observation_id":"16458f34-6e67-4409-b267-c34321a208ce","resolution":{"observed_at":"2026-08-04T04:02:54.452730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.455019Z","title":"Javisgpt: A unified multi-modal llm for sounding-video comprehension and generation.arXiv preprint arXiv:2512.22905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.455019Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:c78c38c6fff16322357c40beaf56e87a602b3dde5f1e7b129ba7fc5371c18c70","observation_id":"002db1f9-8ec1-4c54-8963-c763ae79e93c","resolution":{"observed_at":"2026-08-04T04:02:54.455019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.457179Z","title":"Quota: Query-orientedtokenassignmentviacotquerydecoupleforlongvideocomprehension","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.457179Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:6b723441b3f79a76ec2fa503cb2b8849ded6574f15566f32cede1e534dc793cb","observation_id":"17d987d6-eb0f-4b9c-94fe-1528559f14d7","resolution":{"observed_at":"2026-08-04T04:02:54.457179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.459406Z","title":"Llm-pruner: On the structural pruning of large language models.Advances in neural information processing systems, 36:21702–21720, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.459406Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:28463c5f6ff713e5a097632d3d91ebae9bd7a1b99a3a0897faf86e32366b0346","observation_id":"34f7c4df-4658-4ab2-a502-5c223a79f474","resolution":{"observed_at":"2026-08-04T04:02:54.459406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.461676Z","title":"Ompq: Orthogonalmixedprecisionquantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.461676Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:b0529eb8f190776508371d3eaa1f5885c4b8ffe7a49267a2e46532306cdf0665","observation_id":"9fdf5772-7ece-4cb8-9b19-6f222f231419","resolution":{"observed_at":"2026-08-04T04:02:54.461676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.463908Z","title":"Affinequant: Affine transformation quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.463908Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:003724ed1fc94bc78d1ca5caba8df96c22ea86774cca909da7549a7c530dc190","observation_id":"18f66ed9-9459-48ff-b97a-2420bd797493","resolution":{"observed_at":"2026-08-04T04:02:54.463908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.466408Z","title":"Norm of word embedding encodes information gain","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.466408Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:9efd0b1fc6b39e709f4e980aa95557c2887477f6c0cd0a89d749c46e2a7ee7c8","observation_id":"7dc8079b-e33c-4b4b-b4da-c8c00ba098c9","resolution":{"observed_at":"2026-08-04T04:02:54.466408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.468638Z","title":"Prentice-Hall, Inc., 1993","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.468638Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:129add69b7b16239abc4d87bc03ce0cf3a47e66819e2db0963062387d25b0b54","observation_id":"c0977b41-472a-41a4-960c-2fa59eb9fb87","resolution":{"observed_at":"2026-08-04T04:02:54.468638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.470907Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.470907Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:e76ec694b7a6dd838374ecfb5c75cab16c910ae53ac9d1dd57cd399e8f3a41c6","observation_id":"72f6cacd-4bba-4e32-95a1-0fe2c33d9367","resolution":{"observed_at":"2026-08-04T04:02:54.470907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.473156Z","title":"Llava-prumerge: Adaptive token reduction for efficient largemultimodalmodels","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.473156Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:4e72e815c386842c73b45850f4ebfa817de6767371e825b24885049f5d5dcba5","observation_id":"45082798-ef54-40bc-a8c1-fd0ebd7be22d","resolution":{"observed_at":"2026-08-04T04:02:54.473156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.475377Z","title":"Holitom: Holistictokenmergingforfastvideolarge language models.arXiv preprint arXiv:2505.21334, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.475377Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:db17460ea1e2be26461885f3b5c4460b706bfdbecd6cfce92305e1e7b7d6a189","observation_id":"59f4436a-e2e2-4915-9584-7b39520743f4","resolution":{"observed_at":"2026-08-04T04:02:54.475377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.477789Z","title":"Whentokenstalktoomuch: Asurveyofmultimodallong-contexttokencompressionacrossimages,videos,andaudios.arXiv preprint arXiv:2507.20198, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.477789Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:51fcc908229b2f86d530307d181359ded0178b2fa3a64bcd48e4e0ecfcd920d5","observation_id":"e13f7504-37f7-471b-9130-247bf434fc4f","resolution":{"observed_at":"2026-08-04T04:02:54.477789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.480165Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.480165Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:8c98207f9610747c0eb22979060cb7a432548599d3b7c50050945eefa0bd44b1","observation_id":"202b797a-e3db-4576-8b2a-c09a7bd4aafe","resolution":{"observed_at":"2026-08-04T04:02:54.480165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-04T04:02:54.482439Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.482439Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:182cf0ebd9c00c6748f98d4c7890cb407ed403fad2928a52630faeda1e247be3","observation_id":"9942ec5b-7557-407f-b7d9-2993050d133e","resolution":{"observed_at":"2026-08-04T04:02:54.482439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.485107Z","title":"Lvpruning: Aneffectiveyet simple language-guided vision token pruning approach for multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.485107Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:bb35b8fe5aa0c62c228902ce1fa8ddc2d4f70d1b6b2fd51b776a86d2ad47b489","observation_id":"8cb3ad99-2e98-4a33-883d-366a444027cb","resolution":{"observed_at":"2026-08-04T04:02:54.485107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.487469Z","title":"video-salmonn2: Caption-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.487469Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:8e4e22a83e22fcae198e8e88742b94aac5b1806dbdded6c5dd05b37d9efe1016","observation_id":"389089a4-dba0-4775-9416-aeb0594fe69c","resolution":{"observed_at":"2026-08-04T04:02:54.487469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.489634Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.489634Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:79dcff2a58b1ba00e7456706675270b0db003d2641ca9b4a761614bff73962cc","observation_id":"f1abf4e1-5c5e-419c-b352-268351089ee5","resolution":{"observed_at":"2026-08-04T04:02:54.489634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14582","snapshot_observed_at":"2026-08-04T04:02:54.491885Z","title":"Omnizip: Audio-guided dynamic token compression for fast omnimodal large language models.arXiv preprint arXiv:2511.14582, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.491885Z"},"links":{"cited_paper":"/paper/2511.14582","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:b9c055b87c6ce374729fdc230c77963f93323ba4a6f4c5c8f81eb19fdeb0f254","observation_id":"80f3f3d0-320c-447f-b65e-a8f897e7220e","resolution":{"observed_at":"2026-08-04T04:02:54.491885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T04:02:54.494236Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.494236Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:dafb932f2ad581cd280ac3bdaf0b1c5603d739ae4baae223549a34d8dac5c776","observation_id":"d90096e6-6bc9-4058-8128-d9105b6d4946","resolution":{"observed_at":"2026-08-04T04:02:54.494236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T04:02:54.496554Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.496554Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:cbd24d8e60653daf8dedd1f872ead8241834b610cef83a18f2c16c6a91d963cc","observation_id":"d68d8d24-61c0-471f-8d6a-fa0e68d8048d","resolution":{"observed_at":"2026-08-04T04:02:54.496554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.499048Z","title":"Longvlm: Efficientlongvideounderstandingvia large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.499048Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:bc00bc6caa84861932733b48f85acca7ee75130a2846fb44887d7aa30aa93918","observation_id":"150dbaaf-1f2a-4d27-9ad0-b56e483c3e4e","resolution":{"observed_at":"2026-08-04T04:02:54.499048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.501212Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.501212Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:74468d13a1fbd068ec8f884e620c9d641bac1f5cfd4cbffcb60fbc70ebd2f18d","observation_id":"2a297e47-a33d-4b46-b9ba-98aefa4dca7b","resolution":{"observed_at":"2026-08-04T04:02:54.501212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.503571Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.503571Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:9dc27a233ef067b2ab84949bb188ecee93b523442926443a17762edc3c64f05c","observation_id":"8f0b1861-64ad-44e0-814a-c39585874b8d","resolution":{"observed_at":"2026-08-04T04:02:54.503571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-04T04:02:54.505966Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities.arXiv preprint arXiv:2410.11190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.505966Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:a8be90ff3bf555ceb29292a721e7fe37f7b89f300a1d926e38f11bee97aa0b80","observation_id":"e84d5c24-21e8-461e-969a-542e51c30061","resolution":{"observed_at":"2026-08-04T04:02:54.505966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-04T04:02:54.508465Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.508465Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:5a7282d9f8c2c828cfe78ac0c57e71cb6511a6eff0cbe93f747bbf7ec3e17584","observation_id":"a881aeeb-654d-41b9-aa74-bd3ab75d9706","resolution":{"observed_at":"2026-08-04T04:02:54.508465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T04:02:54.510858Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.510858Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:af4781725ffeaf10cf2350bc1f4d7c3268ae9a0717b912c96f3df6320245c361","observation_id":"2813c016-831d-41fa-9431-b84d010c32e4","resolution":{"observed_at":"2026-08-04T04:02:54.510858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-04T04:02:54.513476Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.513476Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:5a879f5ceb170d888b6cb2406b9c2cb67190079f1f62f6136690de9486bad28b","observation_id":"41fde0e2-583f-4cd2-8245-5a01599fd579","resolution":{"observed_at":"2026-08-04T04:02:54.513476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-04T04:02:54.515743Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.515743Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:0f16b3ed46b1248d5a863c9c4c841c2dad2b064a11f6269d12e98bafbf62031b","observation_id":"2bcccdc2-9feb-42fb-acce-f629ddb82464","resolution":{"observed_at":"2026-08-04T04:02:54.515743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.518149Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.518149Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:c282e6f897962819dd7f86a282772592b4ea390035e17167da2305724a01164d","observation_id":"bdb89aad-2a96-41af-aa93-e67ca05fd351","resolution":{"observed_at":"2026-08-04T04:02:54.518149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.520291Z","title":"Omnivinci: Enhancing architecture and data for omni-modal understanding llm.arXiv preprint arXiv:2510.15870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.520291Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:9393a3e2d17e51cd5ea1a9bfb4c775afa871b796ec3f77b83802741efbb805ed","observation_id":"6bbef8c0-7495-4973-9d00-73a4a76939eb","resolution":{"observed_at":"2026-08-04T04:02:54.520291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T04:02:54.522646Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.522646Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:e00cc2aa5c3ac1951e909ac7e97c08e0efe793f35545276ac329c8bde066f114","observation_id":"dd4ec0f3-2ddf-4830-b903-7a0a7a708e1a","resolution":{"observed_at":"2026-08-04T04:02:54.522646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-04T04:02:54.524979Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning.arXiv preprint arXiv:2503.05379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.524979Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:67ed1473c4a33017a4c517bf786539668288f9835b3d763a7b9c6ac86aecaeb2","observation_id":"89bf6c89-a6a6-480f-ade9-e192819a8638","resolution":{"observed_at":"2026-08-04T04:02:54.524979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08532","last_updated":"2025-05-21T12:34:56Z","snapshot_observed_at":"2026-08-06T03:13:08.180611Z","submitted_at":"2021-08-19T07:03:22Z","title":"An Information Theory-inspired Strategy for Automatic Network Pruning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08532","snapshot_observed_at":"2026-08-04T04:02:54.527486Z","title":"An information theory-inspired strategy for automatic network pruning.arXiv preprint arXiv:2108.08532, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.527486Z"},"links":{"cited_paper":"/paper/2108.08532","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:2f0bb1e91efa254de5cbf086ca13cef0e720473f74fd3731bf0d6fad4f013758","observation_id":"f42ee904-aff0-419d-9760-a9309a7dff18","resolution":{"observed_at":"2026-08-04T04:02:54.527486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:02:54.529833Z","title":"Self-Embed","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.529833Z"},"links":{"citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:ad3f77d56ef39808c3de48261147cc905c38d7cd2f0ba3d9d28bb642aeebe58d","observation_id":"fa2f2caa-5eee-46f6-b717-7e92b3b2fa4c","resolution":{"observed_at":"2026-08-04T04:02:54.529833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.23193."}