{"as_of":"2026-08-11T00:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8349252cf1ebcff276347d236037d24ddd7caf9381aa11dc49bcc0da0e94ba25","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:31:15.912278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:dbc89fa76c1fc3c6f38429700e760d2b6faad51ab3b6af1fd56422431c7e9e5d","observation_id":"1f7a9d0f-656d-42cf-bd48-b50f5982ccf4","resolution":{"observed_at":"2026-05-16T07:59:32.688477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:ad28ab9cba14560535e8c66f86fd364f69898b68524ec32497c3738bdbc3f9cb","observation_id":"5c6a522d-e36f-4c50-bf24-b9a962dfe8a9","resolution":{"observed_at":"2026-05-15T01:55:12.611554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:6626cfa4a1ba3afc82e306526202838461ddc172f3772fc4e9ce76b4ffe9d6e4","observation_id":"8a652af5-5952-4562-ac2c-eb56ebb692f0","resolution":{"observed_at":"2026-05-17T00:50:13.976131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:d179cc8086e0742ac731de4fba4e79e156eb589c8c55b69b94fcda78d9c6a02e","observation_id":"e9f845cc-9fb0-439e-bba0-162ba911374a","resolution":{"observed_at":"2026-05-17T21:08:19.790388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-10T21:31:15.912278Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-10T21:24:48.662023Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:15.912278Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:eb49036b87e6f7bc83d56eafda8450378506822c8856901195d972ddea5931f9","observation_id":"ed753e0f-cf65-4505-83dc-470f8ffcd8d8","resolution":{"observed_at":"2026-08-10T21:31:15.912278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-10T21:10:56.680203Z","title":"VITA: towards open-source interactive omni multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-10T21:03:43.485377Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:10:56.680203Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.06282"},"observation_digest":"sha256:070bec273032c65ce323f6d49be09459f8048a59dc032048b9224592e3e7dd54","observation_id":"4d1b6baf-4f0e-4b93-b34f-a9f36ca54100","resolution":{"observed_at":"2026-08-10T21:10:56.680203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-10T00:02:26.139518Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-09T23:52:58.437414Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.139518Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:1069427ba5399aaf6676dd1dae59e7de31a9282ba7270651f75b3b52730a7dfa","observation_id":"7b3f034a-05a7-460c-97fd-1be3d9d0069f","resolution":{"observed_at":"2026-08-10T00:02:26.139518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-08T22:47:39.128649Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.128649Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:7b567680363e68ee30bc3939ea2a2f76430744aaa86e1d2fa051a65da9120e84","observation_id":"8cc93ee0-cec6-44eb-9cc5-923a6683089f","resolution":{"observed_at":"2026-08-08T22:47:39.128649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T18:23:49.836288Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.836288Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:479c80ba398511c00e2bfc2f0d6ab46b48f8dd00cffd9e6ef842765c77a2ba88","observation_id":"2eaab4af-c665-4c62-9349-65ff4b72a787","resolution":{"observed_at":"2026-08-07T18:23:49.836288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:36:22.224140Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.224140Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:6f01a33fce3ce3b319d06ac87346447084b35e9f14f7ed2239d7683cc47d4ad3","observation_id":"1660023d-958b-4890-88a7-2a40bb1ad2aa","resolution":{"observed_at":"2026-08-07T12:36:22.224140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:35:31.216234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24714","last_updated":"2025-05-30T15:36:19Z","snapshot_observed_at":"2026-08-07T21:26:09.635795Z","submitted_at":"2025-05-30T15:36:19Z","title":"FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:31.216234Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2505.24714"},"observation_digest":"sha256:e71e72be3aa1e9e51337a313ea847c74608c8201cfcabefc79aadde5508a53c8","observation_id":"f450c3a2-f6b5-401a-9db7-6da32c58d97d","resolution":{"observed_at":"2026-08-07T12:35:31.216234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:04:31.519528Z","title":"Vita: Towards open-source interactive omni multi- modal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.519528Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:bf4d84ca388f6b3a021afae549354a3660c3cfc34b9bee6d5291c304b4b86b86","observation_id":"8e9d583b-8ef8-4035-a643-3f27cd917c3a","resolution":{"observed_at":"2026-08-07T12:04:31.519528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T06:07:18.654045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06406","last_updated":"2025-06-25T12:36:55Z","snapshot_observed_at":"2026-08-07T11:49:17.219924Z","submitted_at":"2025-06-06T12:47:29Z","title":"SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:18.654045Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.06406"},"observation_digest":"sha256:0ad9ec3e78d6c60fda3fe1fd206715a8c6d7c0d1959c9d2a5b5d9317aee30e49","observation_id":"448e7ee4-c789-4f20-b6a3-3023fedf271c","resolution":{"observed_at":"2026-08-07T06:07:18.654045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T05:49:53.242431Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.242431Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:cf5c64b4031ef3d4565985d58a0a41b60831e93232cfc012f085a9f70c7140de","observation_id":"6fbb984b-5ef9-49ec-abb0-41193774fd76","resolution":{"observed_at":"2026-08-07T05:49:53.242431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:82ae411c3d79eaad553860a28abc355a4fc660d9c44a8f022515a085f65b8975","observation_id":"8cd04c31-5034-4d57-bb4d-6ba01c0ff23b","resolution":{"observed_at":"2026-05-19T00:12:54.049331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:668a8ae851616d5d6aecc5f0b98e74da0832b392d2451f85e9c3a377bfc899a1","observation_id":"c349ad53-5cca-41ad-8693-53519d1865a8","resolution":{"observed_at":"2026-05-25T08:05:30.791041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-04T23:33:04.402405Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.402405Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:0cad8ce691bc65c5dfee1305caa09047f64ac4a747e9e14a27238cfdcec3670f","observation_id":"f204dd5b-a186-4075-90f4-d271379ccf90","resolution":{"observed_at":"2026-08-04T23:33:04.402405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-04T11:29:31.705443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.705443Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:474edd42e84ceccfcb3a789691aa7c1056f8f991532f554052e3f2c176f34ad0","observation_id":"e3c490bd-0831-4eb7-b0f5-b81e63db752d","resolution":{"observed_at":"2026-08-04T11:29:31.705443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:28de1485207f46bb011923ff6923dbc456fe850f9b0d5dcb35855b23c6db6d81","observation_id":"949449f7-8bea-4dd2-aedf-b8148e916e0a","resolution":{"observed_at":"2026-05-16T05:32:29.561591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:dbbaef0784f259fdc6f75b98593d47112925e9f8e95d100587a147425cd84815","observation_id":"2fabbe87-6013-4be6-9b76-fe9d13619c93","resolution":{"observed_at":"2026-05-17T20:50:15.026920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:f4f641dccbd3efb8afc8ab2aa8b8ed014736c333336e23289f304a0d3e5cfce1","observation_id":"f88d59cb-10d4-4f67-bdfa-7ca045c807f5","resolution":{"observed_at":"2026-05-17T02:13:52.093691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-03T17:16:37.835015Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:37.835015Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:682ad5476b1edad00946ad5600ff14b1207f2657146ccfce1920abd10a6e47a2","observation_id":"2b135497-2fdd-4a84-87f4-30298e5069b1","resolution":{"observed_at":"2026-08-03T17:16:37.835015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-03T13:21:08.665823Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24731","last_updated":"2026-06-23T06:21:28Z","snapshot_observed_at":"2026-08-08T01:51:47.048928Z","submitted_at":"2025-12-31T08:58:30Z","title":"EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:21:08.665823Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2512.24731"},"observation_digest":"sha256:25b257022786776851752196d3c8dc9e218a39437aa98d45ccf8427da2ddabbc","observation_id":"113d6a17-9f06-471a-9729-bfa1aa0e3805","resolution":{"observed_at":"2026-08-03T13:21:08.665823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-07-15T13:43:40.241796Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06577","last_updated":"2026-07-03T04:02:30Z","snapshot_observed_at":"2026-08-02T23:56:12.139811Z","submitted_at":"2026-03-06T18:59:57Z","title":"Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T13:43:40.241796Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2603.06577"},"observation_digest":"sha256:97ab19a9b628c10aef3a4880221c2cb2b1d9632fb419e6561712b8b629d524ee","observation_id":"ef426965-d6e5-4257-a0cd-92f627bc1131","resolution":{"observed_at":"2026-07-15T13:43:40.241796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2604.14951","last_updated":"2026-04-16T12:47:09Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T12:47:09Z","title":"RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:24:18.061622Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2604.14951"},"observation_digest":"sha256:9c46b2ebc3f4bae7ae4ac8b4a1888504a1c4d266af977c1f63445e0de4cfd73e","observation_id":"1695952e-1df4-41f1-b506-c29dd8021035","resolution":{"observed_at":"2026-05-10T11:25:18.402492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-10T23:36:15.762831Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:b0f5dce9b0d1562600f039b361d168f9c06c785e5c50f21c0016e973c4e5954a","observation_id":"ca753013-6163-4fbc-8f4e-c942c90458a8","resolution":{"observed_at":"2026-05-10T07:11:53.690950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2604.19221","last_updated":"2026-04-30T07:45:08Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T08:24:55Z","title":"UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:48.624864Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2604.19221"},"observation_digest":"sha256:0503bd6c5399b85db7f2ca14d777cbe4614ce4ab79bc86ac918dd701ea08c1f5","observation_id":"97036cbc-6701-4384-ab0b-356dbe85f8e6","resolution":{"observed_at":"2026-05-11T12:46:02.870975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.01024","last_updated":"2026-05-01T18:35:49Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T18:35:49Z","title":"EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T19:24:23.119301Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.01024"},"observation_digest":"sha256:ca6c9a7937aa8e17927f1346cbe72159e3b63be9fe39bd356876b301e48fd650","observation_id":"4c36f2f1-afd8-4f2c-b1df-76881acfcfc2","resolution":{"observed_at":"2026-05-11T15:42:01.619900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.03937","last_updated":"2026-05-05T16:27:33Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:27:33Z","title":"MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:34:50.848124Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.03937"},"observation_digest":"sha256:6a9cc8ef31f526ded1f2385af95e338373d2fb8f041c3fedb1069c783a2f0102","observation_id":"350a4240-24af-42dd-8033-7a91c8674126","resolution":{"observed_at":"2026-05-11T16:41:08.314647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:01fcf687ec7f62731629f670553e881daaf1f1ba1653cdff0fa5de22d2d42a5b","observation_id":"5d47c216-597c-43ec-a82e-93a3c66d46a6","resolution":{"observed_at":"2026-05-11T04:15:56.196125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.10199","last_updated":"2026-05-11T08:46:47Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:46:47Z","title":"How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:55.753359Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.10199"},"observation_digest":"sha256:613a8659ac6df2bae44887c088434809e5a68a2ed4838d4379c6aabc4e329905","observation_id":"617f29fc-d179-484e-a997-20ca2f138818","resolution":{"observed_at":"2026-05-12T03:11:19.057777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-08-10T23:43:10.234096Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:61dd2f67d508ce85173c005802ffd6bd7d9402d4f00ba6a8b81a334618800b21","observation_id":"5efd09f5-0c4c-4cbf-ae02-4af985ca8298","resolution":{"observed_at":"2026-05-13T04:52:16.323914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T13:36:44.071188Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:7f8836deb44b70477725b675fdbfa5d77b4b1655b42761398882ce9ce99d6977","observation_id":"54d54f17-5860-4175-87ec-a07557b1b8da","resolution":{"observed_at":"2026-05-20T13:38:19.197089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-04T01:11:42.073993Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:b1011fff9a4fa84997c8d1d0b200708cd7aa0031cf983c486c25fbb1ca5d6116","observation_id":"233be047-3760-41e3-9f02-9057080e1e2d","resolution":{"observed_at":"2026-07-04T01:19:20.323242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.18758","last_updated":"2026-04-03T08:57:06Z","snapshot_observed_at":"2026-08-03T03:07:36.980791Z","submitted_at":"2026-04-03T08:57:06Z","title":"OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T10:16:42.095330Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.18758"},"observation_digest":"sha256:ca089d8e695c506aa0c8d4c8f54e97ee798d8a1cfa88e7e0b5983ae7e2e31189","observation_id":"ea4c177f-4d42-4ebd-9f4b-3cf0d1353fd2","resolution":{"observed_at":"2026-05-21T10:19:59.971709Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.21008","last_updated":"2026-05-20T10:44:56Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T10:44:56Z","title":"A Survey of Audio Reasoning in Multimodal Foundation Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-21T02:08:06.976461Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.21008"},"observation_digest":"sha256:b350db1ff2ab3c86a9acd2a8788b603e2bb2e9758b1c00f5fdc478600d978cee","observation_id":"5f4e2f4a-211e-4af9-84de-35a40c989d24","resolution":{"observed_at":"2026-05-21T02:09:24.302796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2605.26584","last_updated":"2026-05-26T06:07:11Z","snapshot_observed_at":"2026-08-06T08:54:48.250441Z","submitted_at":"2026-05-26T06:07:11Z","title":"O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T18:36:29.376048Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2605.26584"},"observation_digest":"sha256:650d25d2b6f62fcc61c11801a6116a7ad6cbe9d94fe05d21f7d88acd24a27fdd","observation_id":"f5effd5b-0ec5-4d52-9c6d-8567efe829f1","resolution":{"observed_at":"2026-06-29T18:43:50.869060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:51f547dc284d96ad9cdddab037919c19e945272eccedfee531281e52b61161e1","observation_id":"baedd8d4-0e72-43d1-949d-e5d35620a67c","resolution":{"observed_at":"2026-06-27T13:20:57.394243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:4e3f98ae58ed5bf9fce28efe277b583c202f7c2e262ffc8e38148b9600337d4d","observation_id":"b4c4a14f-f9ea-4a76-b00f-8b8505f838fd","resolution":{"observed_at":"2026-07-02T05:56:39.859547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:d506c9b51196a421d1138e48740490105157dbf29881420182207c5f1f3426df","observation_id":"79df11e2-4c48-4224-a532-a2c7c461dbda","resolution":{"observed_at":"2026-07-03T16:38:39.597012Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-07T11:01:55.500168Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:7e19ae383dbd4de9a2a2c8dec6584efa7ea482c84b8bed717ab9f95aad2c2324","observation_id":"2d06a823-eb47-47d0-b9b3-263e1e0e86b9","resolution":{"observed_at":"2026-07-08T02:44:27.583375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T12:00:10.776575Z","title":"Vita: Towards open- source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-09T03:36:22.198828Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.776575Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:9ad10223ceb3001cdf47334b9f5c060c2fd57baf95b3825320fb2438270e516d","observation_id":"1563059e-d21b-4e68-84a5-fffc1a5b873d","resolution":{"observed_at":"2026-08-05T12:00:10.776575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.05211/citation-record","integrity":"/paper/2408.05211/integrity","json":"/paper/2408.05211/citation-record.json","paper":"/paper/2408.05211"},"outbound":[],"paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:03:35.435826Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2408.05211."}