{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4dc13b8d323b98a1fee881923a1879391ca346d8bc24e70ab9c0d4975517f466","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:00:10.950717Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03812/citation-record","integrity":"/paper/2608.03812/integrity","json":"/paper/2608.03812/citation-record.json","paper":"/paper/2608.03812"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T12:00:10.728615Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.728615Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:c23c6e433fb0dbcef4d2cfe31ba4642a479c99daeb1ef0d78b19e9d39ba6bc05","observation_id":"c4ff1c81-251e-4035-8a6d-98e3d0f22594","resolution":{"observed_at":"2026-08-05T12:00:10.728615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T12:00:10.733972Z","title":"To- ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.733972Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:992e52cc134b5f6bf2bb7c5d571a5de991fb003a17155af1ac6b06795bb4f736","observation_id":"f2a2490a-d605-4a04-b8aa-288cb3f7a3f2","resolution":{"observed_at":"2026-08-05T12:00:10.733972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.221401Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"55b64317-3259-429a-9021-2ec9bfef800c","year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.739333Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:176e68cc217ccf716299651df9b0edd7e595f09ce946525b86ba5a12184c582e","observation_id":"85a71cfc-c61f-427f-bb6c-9328324d3d24","resolution":{"observed_at":"2026-08-05T12:00:14.225663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.744559Z","title":"Avocado: An audiovisual video cap- tioner driven by temporal orchestration.arXiv preprint arXiv:2510.10395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.744559Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:e4608b217e58d2a387858be452648764810426e47a9fbc18624a79e5aadf26b3","observation_id":"6b8993aa-07a6-4baf-91de-9cc073e2eb77","resolution":{"observed_at":"2026-08-05T12:00:10.744559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-05T12:00:10.749076Z","title":"Minicpm-o 4.5: Towards real- time full-duplex omni-modal interaction.arXiv preprint arXiv:2604.27393, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.749076Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:aa4770d35a033bf66b96b231196d9bb326a43459856fb5f8573957c202721877","observation_id":"fc11dee5-e447-40a7-bf99-f86c01531b48","resolution":{"observed_at":"2026-08-05T12:00:10.749076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.12056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12056","snapshot_observed_at":"2026-08-05T12:00:12.231244Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","venue":"cs.AI","work_id":"3d62e986-68fb-4ae1-bdd7-d1617b3c0f0f","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.753980Z"},"links":{"cited_paper":"/paper/2605.12056","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:15a0de828156cff54347e349313db3cf90ea97a394b0baf808642ad9e833f302","observation_id":"adf782b0-604e-4e06-ac09-592868da529c","resolution":{"observed_at":"2026-08-05T12:00:12.324177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04804","last_updated":"2026-05-13T17:11:48Z","snapshot_observed_at":"2026-07-30T23:51:10.917702Z","submitted_at":"2026-02-04T17:51:05Z","title":"OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04804","snapshot_observed_at":"2026-08-05T12:00:10.759361Z","title":"Omnisift: Modality-asymmetric token compression for efficient omni-modal large language models.arXiv preprint arXiv:2602.04804, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.759361Z"},"links":{"cited_paper":"/paper/2602.04804","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:732decc733016c63a071046f92a1463b8077ea7fa4b11d226e6bff5fcf092917","observation_id":"d4c6e423-058f-4fc6-a23b-65cb6784fea9","resolution":{"observed_at":"2026-08-05T12:00:10.759361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.208570Z","title":"Unified spatiotemporal token compression for video-llms at ultra-low retention","venue":null,"work_id":"24e03f1f-6bad-4dde-81bd-c0eaa4a1253c","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.763940Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:95677c5d9517ad37107640aa9bf525f67925ca327314a5009b20fa00f023ad60","observation_id":"b6767fe0-689d-4823-a9eb-22133b8c728e","resolution":{"observed_at":"2026-08-05T12:00:14.212702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.195388Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis.Knowledge-Based Systems, 2016","venue":null,"work_id":"66432058-e119-4fdb-9271-225ef3ef464b","year":2016},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.768085Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:34085a6a16c47814aebd1fb554b57ef10333d2b5d251a5d3fc7750118c0f103f","observation_id":"0aa1385b-96f6-4d00-897b-e93558c66bde","resolution":{"observed_at":"2026-08-05T12:00:14.199415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.772364Z","title":"Flashvid: Efficient video large lan- guage models via training-free tree-based spatiotemporal to- ken merging.arXiv preprint arXiv:2602.08024, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.772364Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ff6614ee6e78eb57b51c8611a053911a9893930a203c0a67caeb49e6d1a4e446","observation_id":"c7229e11-888c-461e-bb5b-e131dff37ef1","resolution":{"observed_at":"2026-08-05T12:00:10.772364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T12:00:10.776575Z","title":"Vita: Towards open- source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.776575Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:c4f28517e13e877cfe569da7c537b390926387d80e06a3a506aeca10f28bdfe8","observation_id":"1563059e-d21b-4e68-84a5-fffc1a5b873d","resolution":{"observed_at":"2026-08-05T12:00:10.776575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.182496Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"a48d4026-db76-4727-913a-20ac3e6d0809","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.781252Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:82c927a09ab4ff297c859f2842179d7d51d36fb10ee69e333b39f6b1fadc5023","observation_id":"85f39ece-efb9-47a9-8589-866d897e697f","resolution":{"observed_at":"2026-08-05T12:00:14.187016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-06T13:12:37.106962Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-05T12:00:10.785575Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.785575Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:04bd60a306e58844629bb9fdc56d0c1209877e409c2bb9c45841de65717f62c0","observation_id":"df338285-baa2-473b-a284-b677b5a98a8e","resolution":{"observed_at":"2026-08-05T12:00:10.785575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10324","snapshot_observed_at":"2026-08-05T12:00:10.790061Z","title":"Echoingpixels: Cross-modal adap- tive token reduction for efficient audio-visual llms.arXiv preprint arXiv:2512.10324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.790061Z"},"links":{"cited_paper":"/paper/2512.10324","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:a89ea52e405b27e262b57c1b3cd3647f663b8d3984e344f272c96176556a91c1","observation_id":"8724ec8e-e5ea-457b-b42d-53d63a4e1e83","resolution":{"observed_at":"2026-08-05T12:00:10.790061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.169577Z","title":"Echoingpixels: Aliasing-resistant joint token reduction for audio-visual llms","venue":null,"work_id":"ee90610a-277a-4053-aeef-fa544f7d1ae2","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.794328Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:375fe7591eacbf41fe18e574c0a7e7ee0340b0ebd7653287b3da9f240808998e","observation_id":"e80f3558-050b-468e-920d-7cfe665d1e4b","resolution":{"observed_at":"2026-08-05T12:00:14.173519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.156843Z","title":"Gemini 3.1 pro model card.https: / / deepmind","venue":null,"work_id":"0b087ef3-078b-4d98-a8f4-a51f3d4f4823","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.798302Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:182f3de8a6e0f5b0c803a68934bbf64f18b60b2e93007766c71491d09b5e566a","observation_id":"9e4c7575-aca0-494a-8d10-8be0b01266c7","resolution":{"observed_at":"2026-08-05T12:00:14.160700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-05T12:00:10.802417Z","title":"Worldsense: Evaluating real-world omni- modal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.802417Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:5f9330730c1dd2049307b08c7da52a40b790b392b6e244ea5c259d5d804adc5c","observation_id":"f691b94f-fdd3-45d0-82b7-fb384736a7ad","resolution":{"observed_at":"2026-08-05T12:00:10.802417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T12:00:10.806834Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.806834Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:fef21edfc8573310cff4313e9e4af64803385304a2876c6c4a50b4490c75440c","observation_id":"85fb0f3a-968e-4add-bd8b-17f03ba460b7","resolution":{"observed_at":"2026-08-05T12:00:10.806834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26827","last_updated":"2026-05-26T10:45:24Z","snapshot_observed_at":"2026-08-08T09:46:22.872693Z","submitted_at":"2026-05-26T10:45:24Z","title":"ContextGuard: Structured Self-Auditing for Context Learning in Language Models","version":1},"cited_work":{"arxiv_id":"2605.26827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26827","snapshot_observed_at":"2026-08-05T12:00:11.913353Z","title":"ContextGuard: Structured Self-Auditing for Context Learning in Language Models","venue":"cs.CL","work_id":"b9fe8c19-05ab-4ea3-b9a9-65c557dceab0","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.811574Z"},"links":{"cited_paper":"/paper/2605.26827","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:48145b259dedacc6b2a40658372afd04793e61bd0824aceb117dbe69e79cb648","observation_id":"669715a8-0864-4eda-a1c1-70f44e032344","resolution":{"observed_at":"2026-08-05T12:00:11.978204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.815853Z","title":"Token pruning in audio trans- formers: Optimizing performance and decoding patch im- portance.arXiv preprint arXiv:2504.01690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.815853Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:927b30b8a8ef6e9539d996862760be0c8be93e456ad26ca1b5d1d28e07c20e65","observation_id":"bb040714-fcd5-48b0-a191-969f1ff2c6ce","resolution":{"observed_at":"2026-08-05T12:00:10.815853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.820110Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms.arXiv preprint arXiv:2510.10689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.820110Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:c9b366af9c00d4f1ed52930ae4f9fda9ee8f6da1d2a2c4b1a52c865b44252407","observation_id":"969fe028-3840-4a74-9ff4-ab0d84dfadbc","resolution":{"observed_at":"2026-08-05T12:00:10.820110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22897","last_updated":"2026-07-02T15:39:17Z","snapshot_observed_at":"2026-08-02T20:36:38.008733Z","submitted_at":"2026-02-26T11:35:04Z","title":"OmniGAIA: Towards Native Omni-Modal AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22897","snapshot_observed_at":"2026-08-05T12:00:10.824327Z","title":"Omnigaia: Towards native omni-modal ai agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.824327Z"},"links":{"cited_paper":"/paper/2602.22897","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ceb2404d459e0ad36bb8641c113ccc3b692c84ba37aa2609aeb86aa7a4d48c76","observation_id":"2a535e23-31cd-43b0-b60a-cd5745492821","resolution":{"observed_at":"2026-08-05T12:00:10.824327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.143232Z","title":"Speech- prune: Context-aware token pruning for speech information retrieval","venue":null,"work_id":"a625f873-29b8-4140-9a23-9e8592a7164f","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.829073Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:9b6b967be44cfa82d4f242be76e52fdee56ba9896b852e85279902dd29cd0a36","observation_id":"02549923-0200-415b-82f1-2e61ecf47e87","resolution":{"observed_at":"2026-08-05T12:00:14.147517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.130367Z","title":"Video compression commander: Plug-and-play inference ac- celeration for video large language models","venue":null,"work_id":"272ef83f-81f7-458e-adb1-f02419fea1af","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.833105Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:bf4c4ac2c9183d46c3ae0063feccdc58cef828afe091cab18398b39bb534c17f","observation_id":"ec615e69-17b1-4750-9904-d44b2db9a144","resolution":{"observed_at":"2026-08-05T12:00:14.134724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.116981Z","title":"Gpt-5.5 system card.https://openai.com/ index/gpt- 5- 5- system- card/, 2026","venue":null,"work_id":"e6ca8e50-4688-40b6-9e05-6e3beaf75688","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.837170Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:b1b7a76851c4996a67e7cdb27d437b2007ecaf2b9be6b6293e8f47a89508c00b","observation_id":"1e67b4fa-d291-4650-8def-ea6526ef4f2d","resolution":{"observed_at":"2026-08-05T12:00:14.121235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14458","last_updated":"2026-05-14T06:54:37Z","snapshot_observed_at":"2026-08-03T14:35:51.351999Z","submitted_at":"2026-05-14T06:54:37Z","title":"OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance","version":1},"cited_work":{"arxiv_id":"2605.14458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14458","snapshot_observed_at":"2026-08-05T12:00:11.592182Z","title":"OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance","venue":"cs.AI","work_id":"0e5faf0a-cf09-4d78-9ad9-c2769fb2d898","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.841260Z"},"links":{"cited_paper":"/paper/2605.14458","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:2585267c964aa2a6c0df28cdcdb53bcc12a4ffd98df320634b6dd41698407358","observation_id":"c0be0490-6173-4d6f-bfd8-bde6e8008139","resolution":{"observed_at":"2026-08-05T12:00:11.658798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.103880Z","title":"Clustering by fast search-and-find of density peaks.science, 2014","venue":null,"work_id":"98aa514a-81bd-42fb-b7f4-72284133f42e","year":2014},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.845601Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:60d40d12ff3ddaa4b1cea1aaf2cbf89a8e054392c8567fa37def6ad3a9dbf3e8","observation_id":"01735dad-625d-4a25-ba0b-57e432753fd7","resolution":{"observed_at":"2026-08-05T12:00:14.108069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:14.055529Z","title":"Fastvid: Dynamic den- sity pruning for fast video large language models.Advances in Neural Information Processing Systems, 2026","venue":null,"work_id":"782b8898-c98f-46d2-8122-2312299a8d02","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.849604Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:2948e47a0a45db0705b53643b6cd3b067dd684e3750e978c0c1535dfc1c240c2","observation_id":"c7e7f61a-fc50-4892-8ba9-396f3c1eacd7","resolution":{"observed_at":"2026-08-05T12:00:14.095057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.911125Z","title":"Mavors: Multi-granularity video representation for multimodal large language model","venue":null,"work_id":"0ec9bef2-8320-441c-8d40-2b028ab9eecc","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.853895Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:dc7d5906d80a0fe31283501f48bd73c2f71d8071a956d7b8083e4c72eb4e0650","observation_id":"a797368c-461c-4461-b661-4f748b721c06","resolution":{"observed_at":"2026-08-05T12:00:13.988394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.774659Z","title":"Audio- visual llm for video understanding","venue":null,"work_id":"6a760a4a-26ec-4e52-a3f5-b23c0d564c19","year":null},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.857877Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:69385b816bb29fd0a1c7efdd4ae9eddc759bc11b29578d4a4fd20d5cfbd0968f","observation_id":"1dad8e06-66ef-42ec-b8ef-8d8146649fb1","resolution":{"observed_at":"2026-08-05T12:00:13.846338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-08-07T17:06:38.892486Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-08-05T12:00:10.862282Z","title":"To- kencarve: Information-preserving visual token compres- sion in multimodal large language models.arXiv preprint arXiv:2503.10501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.862282Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:47fc53cc0aab99a10f957f848ace64a2426d694970b899f732feb5853817445b","observation_id":"98885e3e-5829-4942-9e14-7b991be14341","resolution":{"observed_at":"2026-08-05T12:00:10.862282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.866665Z","title":"video- salmonn 2: Caption-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.866665Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:2c2945e679cae0f53612376d388f11ec4ba053c268672f90e89820bb469e687b","observation_id":"5ca6b901-294a-4feb-ad39-e4f4a9168434","resolution":{"observed_at":"2026-08-05T12:00:10.866665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.580374Z","title":"Dycoke: Dynamic compression of tokens for fast 9 video large language models","venue":null,"work_id":"20fdc289-8ea1-4813-92a7-a2b307f6fe2c","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.871020Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:7b9f0113ac6dd24669ab3e93b7bd156cf6cddafb064473c4cc16edb97c8a4c13","observation_id":"58d07e37-2acf-49f2-b954-dc6c6718216e","resolution":{"observed_at":"2026-08-05T12:00:13.663031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.456790Z","title":"Omnizip: Audio-guided dynamic token compression for fast omnimodal large language models","venue":null,"work_id":"d070ae54-29e5-4c9d-9eff-e2dbf9cc2a5e","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.875168Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:39f39aa04fae885f25b95db80e7ef6b2f09ce8b1e421b9c721dd6611e9cd456a","observation_id":"e7911a0d-46d9-46a3-a5ed-b0260e4b4a63","resolution":{"observed_at":"2026-08-05T12:00:13.509379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.879590Z","title":"Lvomnibench: Pioneering long audio-video un- derstanding evaluation for omnimodal llms.arXiv preprint arXiv:2603.19217, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.879590Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:134d2bbbb54769f37995bdfde2fa447f9392ba161ba27030d0a5c67f3ae00858","observation_id":"f599502c-6604-45db-8365-c1e444359355","resolution":{"observed_at":"2026-08-05T12:00:10.879590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T12:00:10.883844Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.883844Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:aa30ed72a889a67318fb054c4cc7e322edd63582e16d32662e6847a6511de683","observation_id":"4f9388e2-8b93-4c69-b335-62a917ab6e8f","resolution":{"observed_at":"2026-08-05T12:00:10.883844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.888273Z","title":"Monet: Reasoning in latent visual space beyond images and language.arXiv preprint arXiv:2511.21395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.888273Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:a3a25d358ab6fe2c6b20b2a5f5247f4e486e4b89585e72a47b687f6d2e77d292","observation_id":"4b29d5af-d0d7-4469-8ab1-0f1a0e14ed1c","resolution":{"observed_at":"2026-08-05T12:00:10.888273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.348040Z","title":"Beacon: Knowing when and how to perform agentic visual reasoning, 2026","venue":null,"work_id":"9b3e9601-adcd-4e2b-a85b-faf2e9793c15","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.892377Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:ee0f43414d03d0c422f507c81a66fba66580fcdd0c031f8827ccaddb4d0f30b3","observation_id":"6ac6f9ca-05d6-47f1-8765-54db3d9cdeb0","resolution":{"observed_at":"2026-08-05T12:00:13.395159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T12:00:10.896454Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.896454Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:9cafcbff50b4edaeae711bd83fa65beb756e97fd228092f66737b8f53f4a92a5","observation_id":"8282b130-6e75-4184-bba7-5950cd3130ce","resolution":{"observed_at":"2026-08-05T12:00:10.896454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.206607Z","title":"Varcmp: Adapting cross-modal pre-training models for video anomaly retrieval","venue":null,"work_id":"64fdf162-c528-4e8f-b9e0-39c96f560412","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.900700Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:a537eb7d23afa070df3463796d82b372331b44791e7950f80977180eb1c76544","observation_id":"701a70f1-3fc6-4030-b6a8-db64f3001a8d","resolution":{"observed_at":"2026-08-05T12:00:13.264426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:13.060199Z","title":"Avadclip: Audio- visual collaboration for robust video anomaly detection","venue":null,"work_id":"ae5125eb-efce-4c28-8f76-86c239d164e2","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.904729Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:c848e86012a2ded0fd2bc9f67a53e6b2e1cdadd7c671c29af4abb15a9fa780be","observation_id":"f595ffb2-ac58-4259-9c6b-752dcc24693c","resolution":{"observed_at":"2026-08-05T12:00:13.136783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20035","last_updated":"2026-05-19T15:55:16Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:55:16Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","version":1},"cited_work":{"arxiv_id":"2605.20035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20035","snapshot_observed_at":"2026-08-05T12:00:11.182689Z","title":"Stage-adaptive Token Selection for Efficient Omni-modal LLMs","venue":"cs.CV","work_id":"69f687d0-fbb2-4eb2-b1dc-36bf0c428a4a","year":2026},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.908725Z"},"links":{"cited_paper":"/paper/2605.20035","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:8c42d124abc3482c93e3dc0cc504064949cea332ecedd88bb2e912f21914b4c0","observation_id":"9aa36018-c1f7-4156-8b9e-ad6fa986daaa","resolution":{"observed_at":"2026-08-05T12:00:11.190235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T12:00:10.913314Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.913314Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:76d6dba6e847a25389630ee5f8d67cbbae0dc20dd00ba8c74e15aae7a464a8b8","observation_id":"e7cfe3c4-3dc9-4fa6-a3b7-e8a13743fa6b","resolution":{"observed_at":"2026-08-05T12:00:10.913314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T12:00:10.917458Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.917458Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:6a16af93fc05bdf68bccd74e266ad33bc7ed7819af4781f26c29fc7cb2f79110","observation_id":"06452d4f-c1a8-44f1-95eb-50b1c332fe3c","resolution":{"observed_at":"2026-08-05T12:00:10.917458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T12:00:10.922366Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.922366Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:64386b0f48629c02229c6f11d7c6bf3e06d00f70beb02b14369a48b8b773f295","observation_id":"f8895f65-c30c-4837-8fe5-590202e4c06b","resolution":{"observed_at":"2026-08-05T12:00:10.922366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-05T12:00:10.926459Z","title":"Humanomniv2: From understand- ing to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.926459Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:458ab58524c210ebb51092471dbfb7620bf9d551c63b74daa915029dd583b734","observation_id":"5ff0a44c-6bed-496d-a2cd-b373b08cf750","resolution":{"observed_at":"2026-08-05T12:00:10.926459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.912880Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"98bf2a8c-8905-43de-8a6f-cba5bb85cc89","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.930514Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:e1b3077fb7712675339a640019e297c6977c1bc93c39976696231396e7d39f99","observation_id":"cba8c6a1-d9af-4899-9b7e-b884074ff5dc","resolution":{"observed_at":"2026-08-05T12:00:12.971267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.742197Z","title":"Audio-centric video understanding benchmark without text shortcut","venue":null,"work_id":"fdc0279d-0822-483b-a84f-8298e43e28d5","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.934466Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:4121fff8aacca2e85c56af299ae7a3969f92567780515a76bc79cc14087a5354","observation_id":"9641e354-286a-4a75-9b54-1649e8272a96","resolution":{"observed_at":"2026-08-05T12:00:12.826632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T12:00:10.938425Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.938425Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:99d6a8cf8cd1ac5f3313df04aec71abd0e77011455b547813462fabed2a10395","observation_id":"efb0d17f-458b-40e1-ab02-c7e005dbd68c","resolution":{"observed_at":"2026-08-05T12:00:10.938425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.612824Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":"90ff5b00-3688-4cae-9719-20dec3c1cb5b","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.942553Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:dca0ac2022935082ae172eaf112f552b25bb4b13ad42dda112cae222e38accad","observation_id":"6589d0ef-0127-47bb-b8c3-cffbb2fe0e68","resolution":{"observed_at":"2026-08-05T12:00:12.680178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:12.491551Z","title":"Debiasing multimodal large language models via penal- ization of language priors","venue":null,"work_id":"f614df90-c96c-4794-a009-326e3262664e","year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.946729Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:90950525fa48c0f667025263381bf646781907fd1a0d7bee3df010d79cf8d10b","observation_id":"ab4978fd-8478-4d6f-b98e-8b08c42cb70e","resolution":{"observed_at":"2026-08-05T12:00:12.551861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:00:10.950717Z","title":"What is this?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.950717Z"},"links":{"citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:0aba427148f78492ebc1ba78e4073b1d93493f8d6d1738881a994718c3a24a99","observation_id":"6b95c888-b354-4cab-b365-f2adae77069a","resolution":{"observed_at":"2026-08-05T12:00:10.950717Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.03812."}