{"as_of":"2026-08-06T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59dc7063cc9779b61f827f6e0388f5dbd7195a1e744644386131e9d25e461b3d","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T02:00:02.786195Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11605/citation-record","integrity":"/paper/2605.11605/integrity","json":"/paper/2605.11605/citation-record.json","paper":"/paper/2605.11605"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":"7bf8a135-4d4d-42e2-82a8-cc562775f57d","year":2022},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:a3e3c1180842269bb7e849d8dea5f13b92475c52fc097116f3e709d8ebf5b355","observation_id":"46427dae-2b9c-497e-a3fe-6b04efb5422f","resolution":{"observed_at":"2026-05-13T13:57:51.647472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-VL Technical Report.arXiv","venue":null,"work_id":"66236878-ebcc-4641-a307-528220d1d7b9","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:f267e75225c06f4c5297019e3a5318f623eb26566b37f038e02f20e4099fac85","observation_id":"8db28d7e-ab8f-4a5f-bbd6-46f11ec9c95a","resolution":{"observed_at":"2026-05-13T13:57:51.558683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VGGSound: A Large-scale Audio-Visual Dataset","venue":null,"work_id":"a7da56fc-7cc3-4d71-8370-ff810fc0381f","year":2020},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:20f1ff58dc058a1091c31378628f8688c2cff0c5582ccbc10a6d3568618930f0","observation_id":"4da67932-a6ff-47df-89b8-04d1729db22a","resolution":{"observed_at":"2026-05-13T13:57:51.536785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:4af107c43dd084da28b3edbde4eaae2c2b9a460c66088dc920e6fb2134f322d2","observation_id":"f6005e4a-e121-4901-b81e-a50ca4690868","resolution":{"observed_at":"2026-05-13T02:02:06.377506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","venue":null,"work_id":"19f0aab9-d897-4ecc-bddb-91dc47eed836","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:0a8a27d57789f49070191b6f77492e224fd9befe5b99488896a3b345f9b551b3","observation_id":"28bab313-2f09-48ce-a36f-85bae1915e0c","resolution":{"observed_at":"2026-05-13T13:57:51.563568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","venue":null,"work_id":"b6866347-4146-4e1f-a25e-3216b38054a9","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:d883b495966454a7a180086077d1a942a5cbf18be35f58da946e0e504dc5fadd","observation_id":"381010d3-a7e7-405f-b127-b642c472fc57","resolution":{"observed_at":"2026-05-13T13:57:51.621269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V AST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","venue":null,"work_id":"9b986ff9-d645-494a-9697-a4121aeb7345","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:f07593665e50d98c056a974f5ddd79034f4aa9cebe997be7c565f23c2145c571","observation_id":"da416ff9-67f0-474a-a4c1-b6bc865a476f","resolution":{"observed_at":"2026-05-13T13:57:51.511176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"StreamingTOM: Streaming Token Compression for Efficient Video Understanding","venue":null,"work_id":"b936016c-6adc-437b-83b8-61cca196290b","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:a46e5b31bb6b411be37746dfd08422a55b5db1ee08f10d52357f57fd63132103","observation_id":"ec5f479e-00d9-4dd0-a200-e539819b6a52","resolution":{"observed_at":"2026-05-13T13:57:51.575821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InternVL: Scaling Up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":null,"work_id":"ededb290-9f40-4a2a-a45e-24f188043a7b","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:04bfb87566a792d9ab953419d660373ad06181356fb9a3b34e4fb0efa863f4d6","observation_id":"527c5493-22dc-4eff-981d-1df508d70c47","resolution":{"observed_at":"2026-05-13T13:57:51.629594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:b477ebf477b3bb20a51328eb73b88f54ac7eba9b888d9eaf85b12bfa62daeac9","observation_id":"a8b010d0-8bcd-4244-88d3-997299a7a457","resolution":{"observed_at":"2026-05-13T02:02:06.362106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time","venue":null,"work_id":"8c213637-7e88-4e6b-91e4-a1fdef972c22","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:e9e2d11928037d601e305c2de384239dadb94d203e90f2cccb0070fa39dd9d75","observation_id":"5e5f7cbb-4923-4063-9cf1-cbffedce71ab","resolution":{"observed_at":"2026-05-13T13:57:51.660046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:6783f2fe0a9fbabbbabd4be39f9a898856af9290b876f8d4f6e300fa4131b83c","observation_id":"cd6ac54a-e8b6-44aa-866d-5d2882258ed2","resolution":{"observed_at":"2026-05-13T02:02:06.342903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04804","last_updated":"2026-05-13T17:11:48Z","snapshot_observed_at":"2026-07-30T23:51:10.917702Z","submitted_at":"2026-02-04T17:51:05Z","title":"OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models","version":2},"cited_work":{"arxiv_id":"2602.04804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04804","snapshot_observed_at":"2026-07-04T16:49:57.262617Z","title":"OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models","venue":"cs.CL","work_id":"1224850f-993a-4c50-9816-1d9aa50d76bf","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2602.04804","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:bf6c0c0d69fd4ff969b6c20490ded8c9ba4d55e89ebcb533f41eaed91fbbf0de","observation_id":"da58de3f-3268-4dc4-a92d-3b6af83600dc","resolution":{"observed_at":"2026-05-14T02:56:19.131480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"0ae98816-b367-409c-a264-23092d15037c","year":2021},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:6607ef7fce1ce691b238823270fcadf79ae0d848a8ba3f850a537d3d01b17317","observation_id":"c0cd9387-cf1c-4926-8411-c15b44abf422","resolution":{"observed_at":"2026-05-13T13:57:51.519927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-MME: The First-Ever Compre- hensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":"45aecb01-a838-4e96-8e29-7be09ea9c541","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:e9229c3d61a46530aa125c5290e91aeba7426062cd49318c9504bb304ecf253b","observation_id":"caa110bc-ebb6-4b78-919c-c55326dfc54f","resolution":{"observed_at":"2026-05-13T13:57:51.524633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"fb3aa3d1-87d1-4b54-9233-859fe5d260d2","year":2017},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:861f35fdedf56e1f7be5769840ac5f6f32b4fd020ecb883d95bae215e0b3927f","observation_id":"9411a143-83ec-451f-b623-b634ac6ab116","resolution":{"observed_at":"2026-05-13T13:57:51.495135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"cited_work":{"arxiv_id":"2512.10324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10324","snapshot_observed_at":"2026-07-03T01:57:32.378836Z","title":"Echoing- pixels: Cross-modal adaptive token reduction for efficient audio-visual LLMs","venue":"cs.CV","work_id":"6ec3df3a-3134-4be9-a819-f12f00eea63a","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2512.10324","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:25bd9e2e48c11069759ff225e4fa9e5d17865ab20648bb376845d0b4e5d8bea6","observation_id":"e53fa6ab-5e4a-4b4f-a2f2-98d15ec110bd","resolution":{"observed_at":"2026-06-23T04:13:43.420881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AST: Audio Spectrogram Transformer","venue":null,"work_id":"efe25b1d-a719-4b0a-aecc-7de0898eac36","year":2021},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:18d54cd823356ee6d723a7e1ab73a2a403ec68df75ab4049a217abb034ba6de8","observation_id":"8ae23397-ee69-450e-b7c1-5c6a6c4e45a3","resolution":{"observed_at":"2026-05-13T13:57:51.498259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OneLLM: One Framework to Align All Modalities with Language","venue":null,"work_id":"519b4e1c-103e-4dff-b301-9ac22aa70b5b","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:db20904a4cb82f9affd5f155bc317d6184b7b643826bd5571eda5f34f5e56d07","observation_id":"152b6d51-3fe6-47ea-a2b5-481acfc3cd9d","resolution":{"observed_at":"2026-05-13T13:57:51.528855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","venue":null,"work_id":"7ab2973a-be5d-4350-8e03-2a31c504d128","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:6da4c62c3ef91e8a22ddb5f8c5fefc20d0cb7b346bc1956112bd140630c1e605","observation_id":"bee92d2e-85e1-4b3b-be17-d9a63bdadcc3","resolution":{"observed_at":"2026-05-13T13:57:51.492104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language is Not All You Need: Aligning Perception with Language Models","venue":null,"work_id":"04848014-a851-44a9-bc71-ceb489253b78","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:3bad4250ddc9a9aec4cb1e293cb82ff45e5e458f08626cbc1fb9929fa731b583","observation_id":"6ca3676d-8686-4580-99ba-1bf0f689ffd3","resolution":{"observed_at":"2026-05-13T13:57:51.638217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:48c982ba069da9b6e1262211fa77f7346c871b2c13a6196b6d4d2518c25b88db","observation_id":"4a52e37a-bf83-473b-bf15-83d521e3d184","resolution":{"observed_at":"2026-05-13T02:02:06.333048Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","venue":null,"work_id":"c630f730-9caf-4e2c-8c47-b3ba2419e05f","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:ab45cbbc0184a01bee77663d506aec2477d765cac78a8d8aa67b9883b5aa7a33","observation_id":"9ac3acee-bad6-4f77-95f5-92fd9e31f6fb","resolution":{"observed_at":"2026-05-13T13:57:51.567710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"STORM: Token-Efficient Long Video Understanding for Multimodal LLMs","venue":null,"work_id":"624f4214-60c9-4802-adf8-c8ddc19d72d3","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:65060a477ca40f9762fcdf6a5a639221ebe509a8c6cc0bf5c77963bd94bdb43f","observation_id":"54f8b596-915b-44ee-b959-d5b8867ac574","resolution":{"observed_at":"2026-05-13T13:57:51.642525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaV A-OneVision: Easy Visual Task Transfer","venue":null,"work_id":"ca10dcb8-97b0-48d1-ae9a-41f152cea29d","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:1a4f5a7fd1ce8dc47f22008618aec0bbed616f761564a820cac1eab7a5c66920","observation_id":"851988ae-deea-4a6e-8b7b-4d62c32f3d19","resolution":{"observed_at":"2026-05-13T13:57:51.670390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.259029Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms","venue":null,"work_id":"0ebfaa5e-4689-4250-a835-aee0b4ce9a33","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:00eba951780e93177639c4ff6deb7e7238fa3ef21426d809f742d1b57dada69e","observation_id":"838e6d47-199d-4410-811c-b9dfff8a762f","resolution":{"observed_at":"2026-05-13T02:02:06.297828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP-2: Bootstrapping Language- Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"8f5544d9-2bab-4bd3-b0ac-12f60e6f0ef3","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:52151b77235bfa622930579cbcc8101262417c672f2a12b4ce785f858c466ed3","observation_id":"10487093-e774-4356-91b5-290f1ce7e967","resolution":{"observed_at":"2026-05-13T13:57:51.545948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoChat- Flash: Hierarchical Compression for Long-Context Video Modeling","venue":null,"work_id":"a9ad1479-bcc3-43f1-8fa9-045df212dfbf","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:0b970924ae8f6260bf590c5a954df1bc16df3ac633e5d8038ca7319d5f802e80","observation_id":"1d8fc051-5434-4c62-a4ca-94775cbbb317","resolution":{"observed_at":"2026-05-13T13:57:51.608600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-LLaV A: Learning United Visual Representation by Alignment Before Projection","venue":null,"work_id":"92735464-a2c3-4421-b6f5-a8353c47eb2f","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:a4c4132eb27c957d56243ea45e6f4bbefa09f32ed6ceb36672215ba29b54638d","observation_id":"9411bb27-a3a9-462a-9b9a-907b1a0b4bec","resolution":{"observed_at":"2026-05-13T13:57:51.584502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Instruction Tuning","venue":null,"work_id":"e2ce8cbc-ba77-4cd3-b713-428fd7696c22","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:21c8a0dfacf67389b564a36406f8349a0a4d9def799d255c0f93cca570fdb1ab","observation_id":"32dc153c-abe0-4935-a8aa-2f85ea2928bd","resolution":{"observed_at":"2026-05-13T13:57:51.587896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models","venue":null,"work_id":"1bbec896-f5bf-4787-94c6-c8be50844ba2","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:6e9459fa59b3a5bf5858ff4f8be8ec51800ee20484126f9461f256522c4e070d","observation_id":"26cbbea0-d15b-44f0-984b-e058915d9b66","resolution":{"observed_at":"2026-05-13T13:57:51.600554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:1c548db188a45694cd3aebcdef7f4900a06b46d3b135e72a28c7e810ede2919a","observation_id":"1dffdf43-1dd2-4240-b85f-02f3f24bb3b2","resolution":{"observed_at":"2026-05-13T02:02:06.307495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":null,"work_id":"fa6c6fad-90ab-46a1-8fe1-be66fb0f7e7f","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:63d56c0b0202f0fd099fef64c4a3a33a25dd917736db61cb78b85c32e5f8f7c9","observation_id":"302028f4-4fd4-48aa-b57e-a31b9ad2f0af","resolution":{"observed_at":"2026-05-13T13:57:51.633942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-07-06T16:55:13.127567Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":"2311.18799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-07-04T08:09:41.279523Z","title":"X-instructblip: A framework for aligning x-modal instruction- aware representations to llms and emergent cross-modal reasoning","venue":null,"work_id":"ddf2bce5-fa68-4204-bce2-2bbfb17b3e63","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:74d4cb32fb3b7052f31e4a4fa61dbc44611fe7d3f286bfe79c9270c60df60e74","observation_id":"1fdfb7a6-5a81-47c0-a436-b1e74a46124e","resolution":{"observed_at":"2026-05-13T02:02:06.328981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:39:04.702591Z","title":"Adapt- Token: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding","venue":null,"work_id":"5fc12949-5d60-43c8-b4b3-7f8147061d89","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:061a7137f8ca9be2a41ab55aea2fa26d66a411de395ae1f9d44a4f2005fc1c60","observation_id":"f268fcbe-6abb-4f73-b567-aaaa13494a6c","resolution":{"observed_at":"2026-05-13T02:02:06.338129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15270","last_updated":"2025-04-21T17:57:21Z","snapshot_observed_at":"2026-08-03T16:37:28.907327Z","submitted_at":"2025-04-21T17:57:21Z","title":"An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes","version":1},"cited_work":{"arxiv_id":"2504.15270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15270","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quicksviewer: An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes","venue":null,"work_id":"7096a70b-cc52-4f06-a895-e73c7ceb15a8","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2504.15270","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:acb9e3904ab7cd8e4846c94f872709c5723a39f09aa5e079961c6b06e57be0f7","observation_id":"606d06ea-4a60-4297-a449-7b85aafe8c0a","resolution":{"observed_at":"2026-05-13T02:02:06.302188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"702eeba4-fc78-49c6-81e5-9331bb72fd24","year":2021},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:628fd8808b8cc9b012c1816cc783e8c503c9657a831c07a22ec7875e20cd5b64","observation_id":"aa97041d-52d6-492a-b46b-d3942462140d","resolution":{"observed_at":"2026-05-13T13:57:51.550241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"413eef4e-b42e-41f9-9504-1d6d69ac2a23","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:cc0849858ae0507570f3a61dbbc002ecffe8dac802d5836d43132b0014d05a12","observation_id":"e06d4365-e617-4d24-935b-60af578bbd59","resolution":{"observed_at":"2026-05-13T13:57:51.651937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaV A-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models","venue":null,"work_id":"d742cb20-4821-4ba6-aea7-9f38771f4588","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:170204d1eaf2351ab1490dbb4ad2ceaa626423e19453f1666f8591a7528ea1d9","observation_id":"9396f416-d069-437d-a162-89689ff91f90","resolution":{"observed_at":"2026-05-13T13:57:51.616654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:31:59.998579Z","title":null,"venue":null,"work_id":"460670e6-33fb-4b33-ab81-875df0034130","year":1948},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:137da42dd7f7db09ef8d5ccfc60bd3d39a5706002a91e50c1fb9fd451ef3fa48","observation_id":"63155665-8e18-4e90-842a-cf4fe96392f5","resolution":{"observed_at":"2026-05-13T13:57:51.489430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HoliTom: Holistic Token Merging for Fast Video Large Language Models","venue":null,"work_id":"edf654bc-02e3-4b69-a1fb-9b7684430daf","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:800adf6ed51be9d53253bda3062920370999794c49a401016c0705898fcae438","observation_id":"4ec4d13e-33cf-4bf4-9f1f-2c8a30f522d2","resolution":{"observed_at":"2026-05-13T13:57:51.541689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"387e3fe5-c3ac-4e06-8e1b-d1530cc6f475","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:6015631d5ef91138a73a1e3cfb795b80a408e92af6231286f05bcaf9438c0790","observation_id":"2e737fa9-64ad-4e62-8cc2-09cc8f167e4e","resolution":{"observed_at":"2026-05-13T13:57:51.625379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","venue":null,"work_id":"c1a77518-995b-474f-bdb9-36d5695659b7","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:06eae4527104bb31b8a7a2fbe4987aa489dbda404a1267dba50bf5b96e675402","observation_id":"aa610cd1-acad-4834-85b6-0e17081cc188","resolution":{"observed_at":"2026-05-13T13:57:51.674737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-07-06T20:52:04.228632Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.10501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-07-01T22:16:15.601342Z","title":"To- kencarve: Information-preserving visual token compres- sion in multimodal large language models","venue":null,"work_id":"1a513a26-4a37-4286-bf16-447b3f1b56bd","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:76b7a48c8e6f9de68837b97a216754e1849e9c757996c266f15ee02e650092d0","observation_id":"718c3c65-f48e-41d3-9823-54f62f526fec","resolution":{"observed_at":"2026-05-13T02:02:06.367035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.281790Z","title":"video-SALMONN 2: Caption-enhanced audio-visual large language models","venue":null,"work_id":"a6dea8e4-6736-44e5-b9d0-6e036ce7a7c0","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:c79872cea2a76c9e2b72e48b93f13f8900c15f569fa9520e7d88eddc2c388072","observation_id":"d84ee85f-ea73-4a96-a415-52cfd8bd78d7","resolution":{"observed_at":"2026-05-13T02:02:06.372567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","venue":null,"work_id":"d42f23ec-ab06-4137-9fbb-c0168cc10dbc","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:4c60c4e4b3e6472d099705e2918f5a9619707a704b9b3384862832e9c83770cf","observation_id":"f1ef4fce-7c5b-4824-9b4e-01de9400d0b7","resolution":{"observed_at":"2026-05-13T13:57:51.664257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniZip: Audio- Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","venue":null,"work_id":"f7c31dd7-5137-456e-9462-c1412207d344","year":2026},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:3bd01a030ae2aefd892690dc5fca376aaec768caedd4e2f2618d57c8b9702957","observation_id":"c216012e-e004-4c7c-bdff-4a4b597749f9","resolution":{"observed_at":"2026-05-13T13:57:51.595117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:1162ec479f671ec7778bc8529f19b0a894d8ad39691744ca78143cd5ec84a43b","observation_id":"97664f33-948d-41dd-a3c3-5e023b1d0c3a","resolution":{"observed_at":"2026-05-13T02:02:06.352132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:00616bcd95e66cddccb8a9e164d7cd8d862be60074f2f187a403652f8128833a","observation_id":"87bb9f0c-cbf7-4397-bc6b-92bff4b09512","resolution":{"observed_at":"2026-05-13T02:02:06.357482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":null,"work_id":"63ac48c4-eb9e-4de0-a29f-1819722023d7","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:e819fdc55e6252d23835a197de79846b25edc74f56788e1642f3eb983831d36a","observation_id":"dbf3d468-c410-49d6-b64e-4cd66733f14c","resolution":{"observed_at":"2026-05-13T13:57:51.604633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:5175c414b8b740e9c296f26091a3dd57ee778f934938e864f114064460881e27","observation_id":"7f846117-6b8e-4e01-8233-7e397344da6d","resolution":{"observed_at":"2026-05-13T02:02:06.287537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","venue":null,"work_id":"29465c53-223d-41ba-b76e-eb02c1d4a684","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:ccf802b35b09350798ce75728088f1047d3a81fb0fc756b4905d6cf393e61ecc","observation_id":"cd3c5254-0b18-4755-89c2-4793b69da1f5","resolution":{"observed_at":"2026-05-13T13:57:51.580575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A VQA: A Dataset for Audio-Visual Question Answering on Videos","venue":null,"work_id":"9c75423a-8a77-4612-96ea-585ed454072a","year":2022},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:d60fc4eef481512d08b1b1045d941bd674c88eb8628fef0cc011d0bfb7db24ec","observation_id":"f38366e9-d8a8-4b47-8a40-c344eb1ddf9e","resolution":{"observed_at":"2026-05-13T13:57:51.612437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","venue":null,"work_id":"688f5b3b-f804-49b9-9304-7585f085f595","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:9e58ec0040318630da0ad798246b8089edf22f8104397ab4d3bdf3a372d48dde","observation_id":"ba526c80-44e9-4a64-b708-13cb480b510b","resolution":{"observed_at":"2026-05-13T13:57:51.515439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","venue":null,"work_id":"201a40c0-3daa-4bdc-846c-d301e3d77fab","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:1b0b2279740c1571d1f374de104a6b5c42f13aca1d5788ad1aaf76156b0bbca9","observation_id":"79822637-f29b-4ac7-8aba-e42ce82ba184","resolution":{"observed_at":"2026-05-13T13:57:51.656044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios","venue":null,"work_id":"9242f1eb-e81d-48d7-afd3-d21806845252","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:929c4280359fbc3942b4c522ed2677755bad4ffd9c6a6686c7aa0ab85c45c001","observation_id":"354ce40a-0724-4fc3-a2dd-47afb20ab06b","resolution":{"observed_at":"2026-05-13T13:57:51.502615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","venue":null,"work_id":"875a51d8-7081-4dad-8a49-db69dab2bba3","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:38e9d0ee9358722ecb87f926137430895f6d2ddb0888708d05bc2c981c357416","observation_id":"8af86676-dba3-40e7-a6d8-f67db91c3888","resolution":{"observed_at":"2026-05-13T13:57:51.506746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","venue":null,"work_id":"e7951abc-d187-4223-a5f1-c3c39bea7740","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:1189ca1f6ea28690d4aa582259a69ef4c48bec777f0bcc9684fb11be648af4b1","observation_id":"d07c912e-6f1d-469c-9db0-8b7b692b9a32","resolution":{"observed_at":"2026-05-13T13:57:51.571838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:fc91fe744ba26db37c8006d6530410660edee1fe2b04422f1d0a6c8f72b8c1a6","observation_id":"7262370a-9725-46c9-8304-e10518785462","resolution":{"observed_at":"2026-05-13T02:02:06.312638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"2f4f18ac-16cb-4aba-841b-411110491c67","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:768aab3aef7a2b6790a9511ded0f245481eb860cdf0a8403d6d1c6ea2d9832d4","observation_id":"46ff8bec-d77a-4928-af29-debcd42e5ce9","resolution":{"observed_at":"2026-05-13T13:57:51.591886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","venue":null,"work_id":"f37a97dd-0457-4362-970b-b6e4a38eaba6","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:3298382a7fd64868a5188a56af769fdc8f2b00660d817b503113e11c2c1be7e2","observation_id":"f7efcaf8-f075-4462-910f-86a11605f658","resolution":{"observed_at":"2026-05-13T13:57:51.532793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","venue":null,"work_id":"4d36bdf1-6115-4a04-9525-33dbc5a62878","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:0a97d785d09000be910e77295cd22c6155bcc549499fe16814d7d0f69c247cfc","observation_id":"fc9069bb-08d5-4a77-9a8a-a561fb4fb24d","resolution":{"observed_at":"2026-05-13T13:57:51.554496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":"2305.16103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatbridge: Bridging modalities with large language model as a language catalyst","venue":null,"work_id":"34ebc2a1-2e2b-46fc-97e2-43a03efce4b5","year":2023},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:29951bfd11e9823a10a3eb64d7c1e13678182fb09710c5fd7562b9fcc3f1e010","observation_id":"9f50a6fc-3ad4-4b69-971b-5fa48ea23872","resolution":{"observed_at":"2026-05-13T02:02:06.318077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17862","doi":"10.48550/arxiv.2505.17862","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":"arXiv (Cornell University)","work_id":"8c7aec87-020f-4959-9199-7df8b9231cc4","year":2025},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:963dccbbaa54482e9120f28c388e751605cbc10288cb57bac445de364d078425","observation_id":"3810f0cd-55ee-4648-8a6d-a09e64088ba7","resolution":{"observed_at":"2026-05-13T02:02:06.323895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3263.3649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"plucked string instrument music","venue":null,"work_id":"d17d3316-6deb-4c0b-bf80-479b5dd174b4","year":2024},"citing_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:02.786195Z"},"links":{"citing_paper":"/paper/2605.11605"},"observation_digest":"sha256:49ec511264845a568f09113beaa1c9bb09f32eb0ed0d2515bc07990572c2d72f","observation_id":"6647d32c-8957-4093-802d-3ef894dd2295","resolution":{"observed_at":"2026-05-13T02:02:06.292937Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":17,"verified_fuzzy":44},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2605.11605."}