{"as_of":"2026-08-22T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d449a1f646dc88106467f6ea24e1f449465378690c949617fdba88321cca56c","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:04.833294Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08794/citation-record","integrity":"/paper/2608.08794/integrity","json":"/paper/2608.08794/citation-record.json","paper":"/paper/2608.08794"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-14T04:34:04.323992Z","title":"Qwen2.5-Omni Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.323992Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:8674b30aacb9c59e93a969678ff16e5a0b92f036ce2f6b2f8960ee65b24e4f56","observation_id":"290bf7ea-f76f-42cf-9227-995e1e933d68","resolution":{"observed_at":"2026-08-14T04:34:04.323992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.332170Z","title":"2026 , doi=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.332170Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:71e60c2619db1068a16a65a7f7ee48dac0757e5f175180265fcae5c3d95d9a61","observation_id":"41c3e960-98cd-4cba-bd7e-e86c7778ccc3","resolution":{"observed_at":"2026-08-14T04:34:04.332170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.338349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.338349Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:09fac84526546b99070d2b2c07799fabde75bff20302d685731b03ed19004b0c","observation_id":"62f56076-ad9a-4f85-aad4-b4098d53d252","resolution":{"observed_at":"2026-08-14T04:34:04.338349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.343768Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.343768Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:55b816cb397c01f5a5b865e0d414d9258830aa9d47d6018aebda5637cf91e2f6","observation_id":"3af5e994-d826-4005-8944-7fc16d7c7306","resolution":{"observed_at":"2026-08-14T04:34:04.343768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.351569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.351569Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:de1d1ac04a4e6aabcaf38cc3fc10d4d027783bb256aa56f8ceb51c5f8f3d0b7a","observation_id":"e4f1db77-f85a-4c11-ad23-b506e707f112","resolution":{"observed_at":"2026-08-14T04:34:04.351569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.358437Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.358437Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:55f190300c8f425284b9711f2b34ef3ea30066834726490c78a49243db678db0","observation_id":"ccfd8d71-a591-4287-b8d5-55dec2339b09","resolution":{"observed_at":"2026-08-14T04:34:04.358437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.364008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.364008Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:e74d795bcf42719422cffbcfaf903c9f138b5045a079f2b980db8c92b9690cdc","observation_id":"45a57932-d5ce-487a-86fd-7eeaf4f3842a","resolution":{"observed_at":"2026-08-14T04:34:04.364008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.370019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.370019Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:b82735e08b82d40264f943e18bddbc367b8ea9453ec026947c0fdfa8794ac80d","observation_id":"906a29b3-ac21-44ff-a46c-00cde8e97541","resolution":{"observed_at":"2026-08-14T04:34:04.370019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.375441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.375441Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:2b2a56b6e702746337a01169d208021d82513030015dc18cd30dc31611cc6a27","observation_id":"7129b256-d0af-42df-bc8f-08975a24980a","resolution":{"observed_at":"2026-08-14T04:34:04.375441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.380504Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.380504Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:c0a2bf695ba5dca6fc4b3647fe76356ae068574470fb7d28d0ebd30cb00d215e","observation_id":"1667be9d-b56b-4448-a0b2-48a09f29e18d","resolution":{"observed_at":"2026-08-14T04:34:04.380504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.385833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.385833Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:ab9f01f7520d1fa6c2a19b2a696528376f8afca7470f67e4b6ab051c6ad3f568","observation_id":"56591d01-76df-48ab-b485-b3d663f24c4d","resolution":{"observed_at":"2026-08-14T04:34:04.385833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.391357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.391357Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:550eeb971bfc75bf597e7a11c4ad439c2749458ab7b33c50bbc69f6d1afe6388","observation_id":"db313d49-0823-406e-ae18-6e7bfd001b55","resolution":{"observed_at":"2026-08-14T04:34:04.391357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.395879Z","title":"LMM s-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.395879Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:56a86c6bfa81c8c70fbe3f32ae8755078e306b384ff669a7cc83f5fecbb074bb","observation_id":"02cd2c1c-c82c-457a-9021-8192c9482b9a","resolution":{"observed_at":"2026-08-14T04:34:04.395879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-20T01:50:23.816883Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-14T04:34:04.401662Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.401662Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:da18139c473128066526ce63b359643fbde13fb443c4af051374ec854ec49de6","observation_id":"94ddffae-aa2f-47ee-83fa-78e024b07ac4","resolution":{"observed_at":"2026-08-14T04:34:04.401662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.406829Z","title":"Baichuan-Omni-1.5 Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.406829Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7a00856916075ac085373e623cb95364d5086a62ab26e308e6f005f455749198","observation_id":"9270c765-1ea8-472d-a095-d4f069c68473","resolution":{"observed_at":"2026-08-14T04:34:04.406829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.410264Z","title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","venue":null,"work_id":"637d4f55-f6e5-492f-a36d-f2c15442f1f4","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.411994Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:6edcd9d23865985f5fb969ba50fe557c572cd7edc0182f138213c216fcfc7f3f","observation_id":"6682a2c7-af30-478b-a4c6-c44d318d0bc2","resolution":{"observed_at":"2026-08-14T04:34:06.415210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.394594Z","title":"LLaVA-OneVision : Easy Visual Task Transfer","venue":null,"work_id":"8f600bfd-62cf-479d-814e-df9f25201136","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.419681Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:65af67aff69d079bfb2093c216f764bd27ad5990f921cf4cf5ffd2ed8c4052b8","observation_id":"bc0daf9b-3ca3-4e6f-8379-677bd9ef0604","resolution":{"observed_at":"2026-08-14T04:34:06.399988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-14T04:34:04.424942Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.424942Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7a69c2a803bf20ad83120d2aa931d6c8d23c924497b57d636cc2bb1321992673","observation_id":"d32a45fc-62fb-479d-9c08-12dee8d169ba","resolution":{"observed_at":"2026-08-14T04:34:04.424942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-14T04:34:04.430937Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.430937Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:06c3d5878f87a671e6ebba9f2fa509728c1f0848e4d20b34e97c35792d91d567","observation_id":"13bd0a8e-d5a8-424c-9362-42bda027e546","resolution":{"observed_at":"2026-08-14T04:34:04.430937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-14T04:34:04.437312Z","title":"VideoChat-Flash : Hierarchical Compression for Long-Context Video Modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.437312Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:eb79f3e3f4f8bc566a098452c22bec43e7f560676676d573c64cbe1f92a4185b","observation_id":"012b1cc9-df6e-435f-aa48-8bbc157a53fd","resolution":{"observed_at":"2026-08-14T04:34:04.437312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.375342Z","title":"LongVILA : Scaling Long-Context Visual Language Models for Long Videos","venue":null,"work_id":"93a38802-920b-43a7-aa4b-d8037fbbd08f","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.442884Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:870d91ff87a425bd7253b4f775d21c99aae23c459feb47de02f3ec1535e2af10","observation_id":"d1b2dc1d-f0bb-4b6f-b77c-f055451be77a","resolution":{"observed_at":"2026-08-14T04:34:06.381587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.358455Z","title":"LongVU : Spatiotemporal Adaptive Compression for Long Video-Language Understanding","venue":null,"work_id":"7da1b3f5-2e26-48a8-9e25-c24407961281","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.449535Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:c96f339a9228e0eb6a7c5bde63d6d9d98b57a7951bdffb625cb55616f4dc0da0","observation_id":"2efd3ad1-3fff-475a-b3bf-7a80ba2b9104","resolution":{"observed_at":"2026-08-14T04:34:06.362809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.342440Z","title":"Video Instruction Tuning with Synthetic Data","venue":null,"work_id":"5ef966f8-0d51-4134-9c1f-3b5f0620e193","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.456081Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7de282a6441daa21314bfaa8810118e9f130b075a6a4e49db8bf07c24b6572ec","observation_id":"c29c0a63-d8a6-4103-a3e5-057db1a96a28","resolution":{"observed_at":"2026-08-14T04:34:06.347526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.326577Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"85ab0797-14a3-4833-914c-b24e732c3563","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.461372Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7cfc1ec97662d23af2ade97a38eda0735fbf5dc79cbea8e3a6103c417bba279c","observation_id":"0037e256-d9b4-4d41-becf-3bb0cec5eac6","resolution":{"observed_at":"2026-08-14T04:34:06.331432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.306760Z","title":"An Image Is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","venue":null,"work_id":"dc18ee59-69cc-4491-a424-7961c9b6c137","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.467654Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:69fafdfaeb725435b095a0f76ebf0bc4d864354b2e1b0d271cbfa943f2fa3cb3","observation_id":"046cf382-402c-452f-ae15-b74a854cb560","resolution":{"observed_at":"2026-08-14T04:34:06.312580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.288273Z","title":"DyCoke : Dynamic Compression of Tokens for Fast Video Large Language Models","venue":null,"work_id":"2e984d21-8f07-4b66-b3d1-db6a981cf09a","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.472640Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:3c5870d7b51d5e04542e1ecfac5a276b1be20a5c55881600d123ad74ae7987d7","observation_id":"20d38b10-bca2-4b62-92b1-39ae80471235","resolution":{"observed_at":"2026-08-14T04:34:06.294426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.269314Z","title":"PruneVid : Visual Token Pruning for Efficient Video Large Language Models","venue":null,"work_id":"08fa0104-5a60-4ee3-ab3a-eee04afbb47b","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.478220Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:65e611ee001d444392612b82bdbecaaf3d9ee3b59c78291cc5bd482517e29d8b","observation_id":"78fd3e83-f233-4299-aec1-21da43ac470d","resolution":{"observed_at":"2026-08-14T04:34:06.274850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.253697Z","title":"FastVID : Dynamic Density Pruning for Fast Video Large Language Models","venue":null,"work_id":"161a22ec-5672-4da5-88c7-5b337f6b44ab","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.482966Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:b2ae711a0a4502a8cb0fa6c2d5c83016cf1378f5f1b72ca31a95f672122fbfe6","observation_id":"5b8b6cc2-04d4-49c8-a708-386667c84984","resolution":{"observed_at":"2026-08-14T04:34:06.259224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.237409Z","title":"HoliTom : Holistic Token Merging for Fast Video Large Language Models","venue":null,"work_id":"fe043e8c-0854-41bd-9c57-ac75a759d840","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.487995Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:6076f3f2cc98edac94c8da67141834a504dd35d8de94fef83b4c096dce80cc47","observation_id":"40ff97e5-5235-41da-9888-f1837cb7c238","resolution":{"observed_at":"2026-08-14T04:34:06.241978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.221478Z","title":"OmniZip : Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","venue":null,"work_id":"4ca75fe5-7272-4e6f-9b38-6f90c294e529","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.492968Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:14e21aeb1976824d011b1a889c3769c6116ed4322a53bc63f82389b9f62d952c","observation_id":"21d7d245-73f0-40ff-ab58-ed4438551f09","resolution":{"observed_at":"2026-08-14T04:34:06.226536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10443","last_updated":"2025-04-14T17:34:06Z","snapshot_observed_at":"2026-08-16T12:41:14.089168Z","submitted_at":"2025-04-14T17:34:06Z","title":"Multimodal Long Video Modeling Based on Temporal Dynamic Context","version":1},"cited_work":{"arxiv_id":"2504.10443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10443","snapshot_observed_at":"2026-08-14T04:34:05.237676Z","title":"Multimodal Long Video Modeling Based on Temporal Dynamic Context","venue":"cs.CV","work_id":"952d3d8c-68e8-4cf0-82c4-83b897fb93bc","year":2025},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.496979Z"},"links":{"cited_paper":"/paper/2504.10443","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d9675568226d818df763bc383e94455ef4f99a7b3a93a895c0d825b7b847ddcc","observation_id":"a27be746-c0a6-49f5-a573-d0fc220d049d","resolution":{"observed_at":"2026-08-14T04:34:05.242869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.206281Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","venue":null,"work_id":"12d3a3d5-a3f8-4b6f-9c2b-a59f849727f4","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.501800Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7c826d5a5bd50a883e09dd66b4c4fcf0d36dda79b717878fe91e1dc1c6b442b8","observation_id":"620e0f27-9d62-4806-9aa2-c697a925b576","resolution":{"observed_at":"2026-08-14T04:34:06.211265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.189505Z","title":"Aligned Better, Listen Better for Audio-Visual Large Language Models","venue":null,"work_id":"8b1a25d2-b806-4829-9a95-dcb66b0227ab","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.508206Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:1873fd79667559f8a3ac247a4f34bdca7de200a746d83b9183d714fe56e80d88","observation_id":"13fc8d40-fc58-4a20-b13a-31960f99fccd","resolution":{"observed_at":"2026-08-14T04:34:06.195410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.173098Z","title":"Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time","venue":null,"work_id":"5cccb790-a2aa-40a2-b9ba-6f1442d76e21","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.513212Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:8cf239798689666d4dee4e9c5709f4e9f997c0aa53d9cf7220c157340b83566d","observation_id":"b0fc5cbd-8661-461c-b8f6-b9e5b68855d0","resolution":{"observed_at":"2026-08-14T04:34:06.178604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.156495Z","title":"AVHBench : A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","venue":null,"work_id":"0c96f39c-ba2f-47f5-adc5-479ae01b28eb","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.517575Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:44442714dd2ffb7a7f5caa511607e5110df7b24a34b9511c77ae5c1dc4eb8070","observation_id":"902cd03c-7cd2-4ea8-97cb-e73a02b6af51","resolution":{"observed_at":"2026-08-14T04:34:06.162128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.140911Z","title":"AVCD : Mitigating Hallucinations in Audio-Visual Large Language Models Through Contrastive Decoding","venue":null,"work_id":"a8e03de6-c24c-41de-970c-b9a12a58f300","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.521649Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d1f81026b62d97da9e18cde9f051566237ece860debdf7a8e5b88b1c091dc587","observation_id":"d1693f6f-bee1-4d10-a7d9-7fe1406d7b6a","resolution":{"observed_at":"2026-08-14T04:34:06.146078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.124343Z","title":"AVQA : A Dataset for Audio-Visual Question Answering on Videos","venue":null,"work_id":"8ac6fd33-b8e2-48d4-ab96-7bf526475508","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.526838Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:ab814bacba533e16da596ad3bd034a6c92a63968cb2fa6fb20644898e5062930","observation_id":"d5cd0636-6da0-4fe1-99f2-9db246767965","resolution":{"observed_at":"2026-08-14T04:34:06.129647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11605","last_updated":"2026-05-12T06:35:29Z","snapshot_observed_at":"2026-08-03T00:28:23.655672Z","submitted_at":"2026-05-12T06:35:29Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","version":1},"cited_work":{"arxiv_id":"2605.11605","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11605","snapshot_observed_at":"2026-08-14T04:34:05.214223Z","title":"Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs","venue":"cs.CV","work_id":"428af91a-09f5-49fa-9da5-2d292af206c4","year":2026},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.531789Z"},"links":{"cited_paper":"/paper/2605.11605","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:fa80437a1588ec0ec39f438b92a2739fc75842e2576dc9e8382ba04b748520c1","observation_id":"e22d1398-0f27-46ea-93c6-8dd4ff7cff4e","resolution":{"observed_at":"2026-08-14T04:34:05.219231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14458","last_updated":"2026-05-14T06:54:37Z","snapshot_observed_at":"2026-08-14T14:04:33.818723Z","submitted_at":"2026-05-14T06:54:37Z","title":"OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14458","snapshot_observed_at":"2026-08-14T04:34:04.537374Z","title":"OmniDrop : Layer-Wise Token Pruning for Omni-Modal LLMs via Query-Guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.537374Z"},"links":{"cited_paper":"/paper/2605.14458","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:bbc2df28592fe185803bd7367e45db87af2c5295ffa6a58fe9a2a3d0a3de37de","observation_id":"3fe58d8c-1878-4b2f-9803-85a650505031","resolution":{"observed_at":"2026-08-14T04:34:04.537374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.108839Z","title":"The Platonic Representation Hypothesis","venue":null,"work_id":"cc01c329-eb97-41ae-9b73-1c5dbfce47be","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.543084Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:8c84284391a214bdd5c947f30c252dd1ceb51a4aa2b37d4188915996ea2e848f","observation_id":"91310692-7bc8-42b5-a9fa-1e60c267c475","resolution":{"observed_at":"2026-08-14T04:34:06.113358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.093939Z","title":"Understanding the Emergence of Multimodal Representation Alignment","venue":null,"work_id":"b719bb02-7a9a-4cb9-a98d-b3ab44fdcc5b","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.548374Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:5b6748b729182bbc9b39e26a9306db3e9dd497654b2d79bc1587900a00c22b65","observation_id":"9ef7ba3c-f573-4ecf-be10-c6beb2478b62","resolution":{"observed_at":"2026-08-14T04:34:06.099263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.079781Z","title":"To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance","venue":null,"work_id":"04be16d5-43d4-491a-afd1-09c31f0bd24e","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.553055Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:480d63d7fceccad0964079458e4d7df55f62f7d7edccc6213c309956df767270","observation_id":"28e9c72b-d78b-4e6b-aa51-377fdc83cbf4","resolution":{"observed_at":"2026-08-14T04:34:06.084016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.064134Z","title":"Similarity of Neural Network Representations Revisited","venue":null,"work_id":"9259080e-a0d6-4ef6-b28e-745239134e7c","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.560219Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:fb21da66d566ed71da8eb3337870999ae145c284dac4d9955118dd44a3992919","observation_id":"15b7d1cb-f380-4f98-8243-c0785b5f547e","resolution":{"observed_at":"2026-08-14T04:34:06.069222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.049541Z","title":"The Effective Rank: A Measure of Effective Dimensionality","venue":null,"work_id":"6c074534-c346-4e2d-b36e-5ecf4db86ff8","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.566143Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:de102964fa63ca1e6e8daca73689aa87dc2a231aaeee6cd7bc3eec32d6aa5b25","observation_id":"9b0de87e-4077-4260-89a4-1fbb96097ea6","resolution":{"observed_at":"2026-08-14T04:34:06.054139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.033951Z","title":"Hubs in Space: Popular Nearest Neighbors in High-Dimensional Data","venue":null,"work_id":"f5f391d1-f957-4849-af3c-90b114c43242","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.572585Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:7d0d79e85ed322c1a029db51bfbcbff8d82e77a113d32d297635284043c8bb6c","observation_id":"221ffa55-ae16-43d9-96de-a74f629bfd4a","resolution":{"observed_at":"2026-08-14T04:34:06.039294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:06.016711Z","title":"Sinkhorn Distances: Lightspeed Computation of Optimal Transport","venue":null,"work_id":"aae641d4-c7bc-4eab-ab93-151efdc1b695","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.580491Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:5153fdb34312ded1e122c1abe211f87727697b3cbb835fed4e6e587c87a99708","observation_id":"26158e9b-58a6-4e1d-99cf-2eacee9f2c68","resolution":{"observed_at":"2026-08-14T04:34:06.022602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.999443Z","title":"Attention-Weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition","venue":null,"work_id":"a2fbc5ae-0a05-47d0-a411-23d6a258b3f7","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.585625Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d429a89b74ef7869f524001ee5decb8f1a136ee17c256a577c2b48e8410b1c93","observation_id":"21d54485-0ab1-40e0-9e06-aa9ba9ab845e","resolution":{"observed_at":"2026-08-14T04:34:06.004863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.984899Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","venue":null,"work_id":"78009b39-d37c-4bae-99b1-670ff263a96c","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.590459Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:b61ae029139a4328cc7e9e4862daeeda64f9bb16bc60b6d84f34b7ac1a104122","observation_id":"23000116-fa86-4888-9946-48e9440d1272","resolution":{"observed_at":"2026-08-14T04:34:05.989671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.970280Z","title":"Clustering by Fast Search and Find of Density Peaks","venue":null,"work_id":"59fe6b7b-ebac-4ab1-89dc-226173dd63a5","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.596465Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:2cc0b2fbfe7493b7b61b64152453ab7f97e4312607d6ed0c866b49058793b874","observation_id":"14738c7a-226a-43fa-a065-1b3d5d3f415e","resolution":{"observed_at":"2026-08-14T04:34:05.975420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.955588Z","title":"and Yi, Li and Su, Hao and Guibas, Leonidas J","venue":null,"work_id":"7cb72a12-d631-4b0f-86d9-02debb452ff5","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.601798Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:ff269604ccb46ac7abdf96cdcc5551e908313e587bd2df09246baf0a0103a7de","observation_id":"98afac82-1ff5-4321-90c8-ce5756a4307d","resolution":{"observed_at":"2026-08-14T04:34:05.960542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.939401Z","title":"Attributing Response to Context: A Jensen--Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation","venue":null,"work_id":"b69c083e-ee61-4d53-b351-1ae1e8d9d217","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.606530Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:49cfe47a409bf68d1e77f745c53ee645df27972372dfa950a095e5f2fc31012d","observation_id":"eceea694-4d49-4366-bbd1-78cb6c2855a7","resolution":{"observed_at":"2026-08-14T04:34:05.944556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.923526Z","title":"Quantifying the Plausibility of Context Reliance in Neural Machine Translation","venue":null,"work_id":"26367bd4-bb29-43c8-9de6-d53d84124832","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.611419Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:1baf09e34772990c833021a0a7c44a711d9ef64dd84b35b6c2907cb5ae43ead2","observation_id":"99514c01-d188-4f6b-ac5e-d7c550e56d6a","resolution":{"observed_at":"2026-08-14T04:34:05.928618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.909516Z","title":"AgilePruner : An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models","venue":null,"work_id":"5de18ea0-4946-4ae7-a0d8-2b5c108a0a7b","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.616843Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:8083709783ccdde1a871d72b3c1d3560216dac14fbea8ed12d09f9014da5f1ef","observation_id":"c0ae69a5-3a3f-4079-bbbd-8d8adb69f650","resolution":{"observed_at":"2026-08-14T04:34:05.914346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.894141Z","title":"CoSeLECT : Adaptive Frame Selection for Video-Language Understanding","venue":null,"work_id":"8a7abc0c-7cd1-4bf4-b99e-6a86ea8455a5","year":2026},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.621422Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:493e2f014e1e5834cc8423512b95d612713c032dbe4e380e25fdc450e466dc0b","observation_id":"2a750601-c2c6-4f01-b93e-ba0fbe99bf18","resolution":{"observed_at":"2026-08-14T04:34:05.899299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.878657Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-Modal LLMs in Video Analysis","venue":null,"work_id":"9eb90b2a-c277-494a-8e85-2d21b45f9320","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.626942Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:68acb48d27e2970105827798b593242c902fbde55e98c920d58dbea214dd6354","observation_id":"7b694104-52af-45fd-a91d-f4678141e143","resolution":{"observed_at":"2026-08-14T04:34:05.883881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.862022Z","title":"WorldSense : Evaluating Real-World Omnimodal Understanding for Multimodal LLMs","venue":null,"work_id":"3546b268-9dc5-411b-8c4f-43bdc8d1c61b","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.631808Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:f907837e9e7b1cdb239bbd89bc270e3e7969a3dce4ec120081d1eb395ac35c1e","observation_id":"926d55fb-cad7-4a8d-b1f0-7d9814db5e68","resolution":{"observed_at":"2026-08-14T04:34:05.867057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.636738Z","title":"Daily-Omni : Towards Audio-Visual Reasoning with Temporal Alignment Across Modalities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.636738Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:3851b2a655ab7ab6c6b0e61757c2598d7359fd79577a99772d95c3f05a154055","observation_id":"64c8f548-9d0a-4641-9309-e91cefd6ff86","resolution":{"observed_at":"2026-08-14T04:34:04.636738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.846687Z","title":"Audio-Centric Video Understanding Benchmark without Text Shortcut","venue":null,"work_id":"9e298b78-82e6-4b8e-813f-61596bf6b761","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.641834Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:204116ea0b5a5d6e4383e89025611d994f1a3eb98def05a3501ca5584ce5e291","observation_id":"d9ace57e-e148-4d8e-af3e-ce6cb554f901","resolution":{"observed_at":"2026-08-14T04:34:05.851676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.830620Z","title":"Diff-Foley : Synchronized Video-to-Audio Synthesis with Latent Diffusion Models","venue":null,"work_id":"2cf743ee-77e5-4dae-9438-378f65e3ed81","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.646684Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:882aa08468032a56fc41f1c77d47953b9fecdcbea88b039b8c05c5bd5560ed55","observation_id":"e3912377-8156-48c7-9e22-962c616d9b24","resolution":{"observed_at":"2026-08-14T04:34:05.835798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.814308Z","title":"Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","venue":null,"work_id":"e4d377e0-3056-4767-b4b4-a8f7e5a1a41c","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.651487Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:4295995b77d89c380cbfacdb98f70e25843415bf7d0221e0cbb56575ebd63554","observation_id":"178ccf26-e96e-4c2c-a7a0-0e367b3799d9","resolution":{"observed_at":"2026-08-14T04:34:05.819206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.799469Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"0d91f63d-d77a-477b-afb9-1616e66deb31","year":2026},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.656263Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:fe332002648ecce35fbadee0dc623cf7be8c8d1e3cfd1a66ac7684281803c014","observation_id":"33098789-4471-45a3-a7c5-ca33a8f5a5f8","resolution":{"observed_at":"2026-08-14T04:34:05.804628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.784287Z","title":"FlashVID : Efficient Video Large Language Models via Training-Free Tree-Based Spatiotemporal Token Merging","venue":null,"work_id":"8bb440d3-119a-478a-b50d-fc83b78b76a5","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.661286Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:1eabe3fef806ec3a3f30ccf97c80c5aa04485732a9224bf4cd66803729078f8f","observation_id":"ac9ede9c-465a-42dd-9f9a-382d03908a40","resolution":{"observed_at":"2026-08-14T04:34:05.789612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.768058Z","title":"TopV : Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model","venue":null,"work_id":"9c2ab8f6-3694-42e5-8800-5ff62fc9e78d","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.666530Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:c863638e1ac5991f89d676753fb3b1e6440e3638d3a59ac7e1cfa4370b092290","observation_id":"edad8f17-c128-48f6-890c-5c7e6e0e3ba8","resolution":{"observed_at":"2026-08-14T04:34:05.773216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.751888Z","title":"PyramidDrop : Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":null,"work_id":"1a7f8033-2ef9-4765-ac5f-a00fcbd5fc07","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.672141Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d832cac9eb99dea40d001e94cfc70cd25ce6e63cb5345d8e85872371315e9166","observation_id":"cbd5359d-9be7-44c6-8f2a-0f0c753fb91e","resolution":{"observed_at":"2026-08-14T04:34:05.757400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.733684Z","title":"VoCo-LLaMA : Towards Vision Compression with Large Language Models","venue":null,"work_id":"65d2efa3-c8d9-4c23-acd1-5783e6762c24","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.678298Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:957fc0470ce401c4699c4e62ec985a2609bed2954e2c7bafc5774b685a7f6c32","observation_id":"8719b179-d9f2-4c69-a8e0-2cd756b375cd","resolution":{"observed_at":"2026-08-14T04:34:05.739265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.717063Z","title":"TimeViper : A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding","venue":null,"work_id":"88f6e9ee-24f8-4f0b-a25a-1116aa665a0c","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.684596Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:9ca1bb3524e3516da64c6cd574e6881fcf93a280b60d9f99d44e0ce7d781bc8f","observation_id":"54a91276-250e-4db6-a8c7-3fe73e6ab9e1","resolution":{"observed_at":"2026-08-14T04:34:05.722897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.701051Z","title":"Token-Efficient Long Video Understanding for Multimodal LLMs","venue":null,"work_id":"9038f5d6-eb39-4fce-a874-3c3a9fecc2d0","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.692524Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d4726dc5c31c4001624c2c518be92b04d611e4ea0ec15f11751926c72d95eb3c","observation_id":"1835568e-29b8-43c2-8073-3cba45d81be0","resolution":{"observed_at":"2026-08-14T04:34:05.706189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.684725Z","title":"BIMBA : Selective-Scan Compression for Long-Range Video Question Answering","venue":null,"work_id":"f110024d-a976-4358-95d5-ff2d276878f8","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.701786Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:5f59f35db2650d79c10720981f045fb1a54320294a4daf073c1991ed429f6dbb","observation_id":"73a0f927-b83c-46b7-8d13-6d73085bc84d","resolution":{"observed_at":"2026-08-14T04:34:05.689244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.708133Z","title":"AdaptInfer : Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.708133Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:80f9929fcc5e903ca368abfd9bbfcfb59c89c28bd99c6847cc2b3fbfe079b4a1","observation_id":"7a67e39e-9b33-4641-8368-58aee9764a30","resolution":{"observed_at":"2026-08-14T04:34:04.708133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:04.713517Z","title":"FastAV : Efficient Token Pruning for Audio-Visual Large Language Model Inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.713517Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:c3e9cff5c64f962c758065b6dbb04f821e2d6c635cb0edb8003a589ca39b322e","observation_id":"e2a22333-4a4d-4a21-9f95-b7a7aa0a9d86","resolution":{"observed_at":"2026-08-14T04:34:04.713517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15685","last_updated":"2026-07-08T06:29:12Z","snapshot_observed_at":"2026-08-21T07:23:41.518148Z","submitted_at":"2026-03-15T15:22:06Z","title":"DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15685","snapshot_observed_at":"2026-08-14T04:34:04.718348Z","title":"DASH : Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.718348Z"},"links":{"cited_paper":"/paper/2603.15685","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:9351ee83b88049357c1fee3c6923c1b457025e4ea022f6016892e9dbd9373358","observation_id":"44a6249d-59a1-479a-8523-99c9fcc1da8a","resolution":{"observed_at":"2026-08-14T04:34:04.718348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18041","last_updated":"2026-05-18T08:33:52Z","snapshot_observed_at":"2026-08-15T07:39:26.463745Z","submitted_at":"2026-05-18T08:33:52Z","title":"OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.18041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18041","snapshot_observed_at":"2026-08-14T04:34:04.937599Z","title":"OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models","venue":"cs.CV","work_id":"493b6ac8-66cd-4550-9b94-4468c20fbdcc","year":2026},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.723034Z"},"links":{"cited_paper":"/paper/2605.18041","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:6dd87a6079d43b0907325144fb59a81b5dd2b6eb1e9fa5335abfcc8ba50e47f8","observation_id":"c406ce49-8f1f-40a5-abe3-88b8e52210ba","resolution":{"observed_at":"2026-08-14T04:34:04.944999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.670187Z","title":"EchoingPixels : Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","venue":null,"work_id":"164bdd05-d030-4b69-8d3a-80587cbc994c","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.730466Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:e21f505125497a8048c359b55af6330c1c4e95705257eb6ab0cf695d37a181cc","observation_id":"3157ce29-3cc7-4c34-9b3a-85498bb68e4a","resolution":{"observed_at":"2026-08-14T04:34:05.674878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.654869Z","title":"OmniSIFT : Modality-Asymmetric Token Compression for Efficient Omni-Modal Large Language Models","venue":null,"work_id":"887b7fe6-3c0e-4570-8d1d-0552793237f2","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.737016Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:469be5e73b2ef7dac0e0f910792f83668b089897fc9f250a7150c3546a422d8d","observation_id":"65960827-8c85-46d3-9902-1a4db2967499","resolution":{"observed_at":"2026-08-14T04:34:05.660121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.638949Z","title":"Audio-Synchronized Visual Animation","venue":null,"work_id":"6d40b034-4177-467d-8335-a2c705d062e7","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.743151Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:dfaf9432aa0b3364f957075c9c91b13107f6b4c4477539c2054b09505e4a6565","observation_id":"725b0517-0e75-4d52-aaa9-4f046de9c8c8","resolution":{"observed_at":"2026-08-14T04:34:05.644548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.622266Z","title":"Objects that Sound","venue":null,"work_id":"b65d730c-2859-49b8-9a5a-4454b7d7bee1","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.749758Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:49dc6fce1b7d3d1119e28a342c25cd8a404253a5bf3abc186c131099f6fc23cb","observation_id":"a9ccf354-fc5b-42ce-8c72-2ce9b5bdff08","resolution":{"observed_at":"2026-08-14T04:34:05.627064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.605243Z","title":"Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature Alignment","venue":null,"work_id":"a5d6d142-c47d-4d02-ba45-8e0a77b84165","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.755487Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:35c893cd1a4ca1385b412e89db29df77eb8a39c498a4b9ca27de0453af695218","observation_id":"dd6af23b-38f1-4492-a931-706e676457f0","resolution":{"observed_at":"2026-08-14T04:34:05.610601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.588299Z","title":"Anchor-Aware Deep Metric Learning for Audio-Visual Retrieval","venue":null,"work_id":"054f3556-15fc-4623-8c97-d494c77fe282","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.762439Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:12d9c0125c586f23119a2b6748eacc0d6d3646185ed0ca1e34f73b8b6feeba10","observation_id":"95d0c50f-adb8-41f0-abff-99cc055106ae","resolution":{"observed_at":"2026-08-14T04:34:05.593473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.574285Z","title":"Audio-Visual LLM for Video Understanding","venue":null,"work_id":"ec28401d-79a9-4117-9b17-9f0a201fd8fb","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.768260Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:72c2d59e51ddf2106898bbfb2db256cedff0b67c30d11b9c77c2bf800962806e","observation_id":"27a66c54-1874-4f38-bc51-46fd99e6ce8f","resolution":{"observed_at":"2026-08-14T04:34:05.578614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-08-19T16:55:33.365127Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12056","snapshot_observed_at":"2026-08-14T04:34:04.773342Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.773342Z"},"links":{"cited_paper":"/paper/2605.12056","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d0a2b212c24ed9c9bc513e2f1851c7727ef1f23f5edf86e3426b8277f75ffb16","observation_id":"1ef972aa-acf3-41ab-8951-38a0fe816153","resolution":{"observed_at":"2026-08-14T04:34:04.773342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20035","last_updated":"2026-05-19T15:55:16Z","snapshot_observed_at":"2026-08-16T05:56:07.086263Z","submitted_at":"2026-05-19T15:55:16Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20035","snapshot_observed_at":"2026-08-14T04:34:04.779683Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.779683Z"},"links":{"cited_paper":"/paper/2605.20035","citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:45577c38f60362d47c478f6598a21eba051c12ee580f0f7ab7639cea6633d113","observation_id":"6d2819aa-50b1-4714-a53d-552641e0bdea","resolution":{"observed_at":"2026-08-14T04:34:04.779683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.558527Z","title":"Temporal Auditory Acuity","venue":null,"work_id":"ee2a882c-d5c6-4384-b9c8-0994e0305548","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.785326Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d343b2e471eeeb1f51fbb8fd9165d4ed5855bcea6dfd41266b34e246354a9000","observation_id":"9e82ba95-0465-4a0c-aa11-7e8ab7d3586d","resolution":{"observed_at":"2026-08-14T04:34:05.563096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.543825Z","title":"and Warren, David H","venue":null,"work_id":"eac5548b-cdac-4158-b283-06299e1d223f","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.791209Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:4154f7a16a62e8f299519da169ef3406387c56ed4d3c1a0363d18cbd13a10d5d","observation_id":"56bc9745-d559-4a8c-9484-922bf615b84f","resolution":{"observed_at":"2026-08-14T04:34:05.548516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.528026Z","title":"What You See Is What You Hear","venue":null,"work_id":"bfe9ff04-d7e0-4354-86a3-fff3f3d7d5f5","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.797499Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:ad76744e20515d65a2286c527d1d640ef1a4de25ba5c2c35f16544de38b1d778","observation_id":"a0b1ded9-fb54-41ec-8aa3-317b48451716","resolution":{"observed_at":"2026-08-14T04:34:05.533231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.512952Z","title":"and Olshausen, Bruno A","venue":null,"work_id":"cadd607a-3ecb-4f31-b612-085cd449d1b8","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.801575Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:41f232a5eddd9cac2b583b0ac3d20cf5cd1354e08a430bf7d9840541f554dcc0","observation_id":"6d880b55-d4cf-4bcf-a020-0ea538a89017","resolution":{"observed_at":"2026-08-14T04:34:05.517596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.496427Z","title":"and Theunissen, Fr \\'e d \\'e ric E","venue":null,"work_id":"17599328-4133-40cd-bee8-83afb6a754ad","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.805958Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:d1375c9e775a5a1d222d6ceab2bc270f38a584fbee02b8a55c1c66a1cb7d62e3","observation_id":"aca657c4-db95-4e83-bae4-dcefca7f6698","resolution":{"observed_at":"2026-08-14T04:34:05.501640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.480889Z","title":"and Plomp, Reinier","venue":null,"work_id":"b72055bd-4db3-4086-80df-b14b06af3e92","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.810078Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:dd26f0cf03a7274495271b5c77b7ad69446a7a768037094345b970f6b1ff16a6","observation_id":"1e95843f-0875-4405-958f-ac4d56a8a436","resolution":{"observed_at":"2026-08-14T04:34:05.485468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.464920Z","title":"and Zeng, Fan-Gang and Kamath, Vivek and Wygonski, John and Ekelid, Michael","venue":null,"work_id":"8abbe03f-d093-4e53-8e6f-680c85c918f6","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.817120Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:896d528790a87abc130be89eb258b9488cce20ac9ff6517bda56f945fa368558","observation_id":"e42a8b96-ec5a-4b3f-8af7-b40c58a1d004","resolution":{"observed_at":"2026-08-14T04:34:05.470311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.448918Z","title":"Different Languages, Similar Encoding Efficiency: Comparable Information Rates across the Human Communicative Niche","venue":null,"work_id":"85d34def-b129-4995-8aef-b3cad5587ea0","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.822617Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:6f1e2f93c6cd22132be4d6b93b5b0727c206a517fc84b83f450d4882dddde5f2","observation_id":"68185178-c98a-434c-b905-241a5b234e5c","resolution":{"observed_at":"2026-08-14T04:34:05.454116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.430657Z","title":"and Poeppel, David","venue":null,"work_id":"a73bdd8c-f834-4ac4-934d-cb62cf2e276b","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.827388Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:916e57d670a08c0a18cc3a2e5f7cf235606eebaff9d8c8057df8787fe025f9f2","observation_id":"76ff274f-e5be-43b2-bd9c-db1223759c91","resolution":{"observed_at":"2026-08-14T04:34:05.436834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:05.413460Z","title":"and Stevenson, Ryan A","venue":null,"work_id":"202b1f05-a4d0-484f-9a65-3a4243c780cb","year":null},"citing_paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:04.833294Z"},"links":{"citing_paper":"/paper/2608.08794"},"observation_digest":"sha256:29e308556dc40e2fa668352142f23732dd7a0a4c0b12b1d778af5f7db6629fa1","observation_id":"5245dd19-7af5-4484-bfba-148ca37450c7","resolution":{"observed_at":"2026-08-14T04:34:05.419165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08794","last_updated":"2026-08-09T16:18:41Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-22T11:56:56.835826Z","submitted_at":"2026-08-09T16:18:41Z","title":"Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":3,"verified_fuzzy":63},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2608.08794."}