{"as_of":"2026-08-09T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd3ff6b418c0db6c047102b3fbed1bb66a2d8fd3dd3ec816d1c7afbf9f897dec","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:19.591854Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T06:35:35.951554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:38:39.602552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:276338b9694a3114ac6ac771be585d1cb5b68703bfabf621d3cf6eaf4489c034","observation_id":"286ba852-3dfa-43a3-9a01-4abb28a5dfab","resolution":{"observed_at":"2026-05-17T02:13:52.168111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2604.08000","last_updated":"2026-04-09T09:06:13Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:06:13Z","title":"PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:40.242925Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2604.08000"},"observation_digest":"sha256:d77c3e631bedb8b2015db4b6aa0fb73b6d25df342ac54e4c8ec29da177d6297c","observation_id":"20d11b5b-424b-468b-98b5-45b0698792ac","resolution":{"observed_at":"2026-05-11T05:30:59.686225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:8f7465e4edac2de298dea930368ff4b0642cce7d61709e3e55a9729c009c8748","observation_id":"b3a8cf48-e086-43d3-bc8e-60ddc7414b0b","resolution":{"observed_at":"2026-07-02T17:27:15.634543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:67a122ffe7666a07e49cf133b218edc055eda24f117a7277c731b19b0299194b","observation_id":"95af9d12-ec95-40ab-8db1-5aad1f844823","resolution":{"observed_at":"2026-07-03T16:38:39.603859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Stream-omni: Simultaneous multimodal interac- tions with large language-vision-speech model.arXiv preprint arXiv:2506.13642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-06T10:36:18.804889Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:1ccf44007c29cef2c38eb49ba0b1605bccd3636c0111e30167846abb7be507ee","observation_id":"f28a4588-daff-4cac-8c3e-8020f4f57764","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13642/citation-record","integrity":"/paper/2506.13642/integrity","json":"/paper/2506.13642/citation-record.json","paper":"/paper/2506.13642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.603120Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"2f17c8ae-f146-4e74-b01b-c17f0a67f5e0","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.211972Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1ee6e3e477e190854c6876600b4c58527e2c507c9610919a08ae70da4b5f4e72","observation_id":"99f2d984-0e85-404f-af46-d47bad206dc3","resolution":{"observed_at":"2026-08-07T00:33:21.616625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.555835Z","title":"Gpt-4v(ision) system card, 2024","venue":null,"work_id":"490cc93b-9ac1-4540-adee-86b1e5f9ed6b","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.217907Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:b86e597d173123fd2cb735ec26851302b54f91603f2434d9d13168ca688bcb71","observation_id":"4ca0a7a8-44db-47f7-ba61-10986922dad3","resolution":{"observed_at":"2026-08-07T00:33:21.579132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.513995Z","title":"Visual instruction tuning","venue":null,"work_id":"96aa7385-1b4c-4451-a23f-e4fd402444d1","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.222673Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3c95af85cc57ae7b99896ce5e8ef3aa26989479c27e40e55cb1028c8f72b966e","observation_id":"cb87d4dc-dd24-4c03-98d4-d07b0c69ad42","resolution":{"observed_at":"2026-08-07T00:33:21.534744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.483224Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"b0ec8cbc-7615-4553-a8f2-2142746ed016","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.227705Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:602525e314f70599cd74c19aba0c66e4acb1189a307689ce07fe594bde9684ad","observation_id":"491b9874-b198-45ae-8e7b-ab812f1ef63d","resolution":{"observed_at":"2026-08-07T00:33:21.490643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.232753Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.232753Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:558b960bee4b98411a74f932257151263c63aa67ec624b033ff4cbece0449016","observation_id":"5c78f174-2af0-4e89-8c5c-5555031f56af","resolution":{"observed_at":"2026-08-07T00:33:19.232753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:33:19.237792Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.237792Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:26ac04b169a41e0aeb6ae37478b7084edaffcace7ec514621f14d6b303731810","observation_id":"b9c087cb-4c3b-42f8-9a46-81de19f1e5a2","resolution":{"observed_at":"2026-08-07T00:33:19.237792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T00:33:19.243615Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.243615Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:874530370e70a0509bbeb8838fb4b223874b24bf203c76dc08bcbc2c4b3f84a4","observation_id":"1ab3b4fb-bae9-4a7b-a7d3-1e62ea7e4305","resolution":{"observed_at":"2026-08-07T00:33:19.243615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T00:33:19.248709Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.248709Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:030e461983c25c13202a2bcafccfbe4982284e3daf77c55d64700d0d7d7c09b7","observation_id":"c1b7e80d-0a19-4bc4-9c34-91e24f446e9a","resolution":{"observed_at":"2026-08-07T00:33:19.248709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.445003Z","title":"LLaMA- omni: Seamless speech interaction with large language models","venue":null,"work_id":"94546496-a069-4c08-a40a-56bac90aae45","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.253606Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:4f2ddbbbdc953edc7dfa40aa238e8c9f8fd2464a4366ba4c93f01982b03ca21b","observation_id":"7448f4ea-2857-4560-beb2-e3769993f9bd","resolution":{"observed_at":"2026-08-07T00:33:21.452144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T00:33:19.258298Z","title":"Moshi: a speech-text foundation model for real-time dialogue, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.258298Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c98101fe65d072ce959aeaf9097ea2572b59cc0acc5386362cb1362a12be75a8","observation_id":"e1373ac1-5099-4818-8963-e2ba1604d6b3","resolution":{"observed_at":"2026-08-07T00:33:19.258298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T00:33:19.263029Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.263029Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d5baf9c0ece4c1b62adf768d0987b24e781e654f97d89dfe57870333e0e9ad20","observation_id":"171ac415-b9c8-47de-aab3-1bd0b16a5aec","resolution":{"observed_at":"2026-08-07T00:33:19.263029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T00:33:19.267903Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.267903Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:4c2323eb9271b4af6a1dd96b273d931a2535cd8420211a8611dec22d666be848","observation_id":"3c0249fb-3f19-4f57-bc5e-ef16e778e3a3","resolution":{"observed_at":"2026-08-07T00:33:19.267903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.273419Z","title":"Baichuan-omni technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.273419Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c889b618ae3ad075f6565dbd2c33dd2e7ea2f01fc6b34fee88b49fde207269d1","observation_id":"00c9d13f-5346-4bb2-ad89-999189f95508","resolution":{"observed_at":"2026-08-07T00:33:19.273419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T00:33:19.277910Z","title":"Qwen2.5-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.277910Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:f7fa3142de2ce10a0da5d46585e65951a28bc146af7888371641cff5d0cd81cf","observation_id":"0adcf620-700a-46e1-a44e-26ca606ba35a","resolution":{"observed_at":"2026-08-07T00:33:19.277910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.282753Z","title":"Connectionist tem- poral classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.282753Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1fb427805614224be2b127daa364e47bce0fc0247e083fef43f50822b2cb7b0d","observation_id":"88f62f36-3081-4824-8222-4e2ba58ee3fe","resolution":{"observed_at":"2026-08-07T00:33:19.282753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.425457Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"71fafabc-8429-4051-923d-13e15d7808b7","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.287814Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:a3414eb15796b82023d3127c50d5da5b519c800f9dc69fbb0c3c487d6f372d04","observation_id":"77b2176b-144e-4162-aa55-adcd1168d97c","resolution":{"observed_at":"2026-08-07T00:33:21.431137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.406989Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"5e553191-25c8-42ae-bedb-144a453ab721","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.292479Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:2a16ac84ffdc233b45ae6ee4487be5f9bb20f56c1f846b6693915a45d091b2a9","observation_id":"e545fb63-b739-4379-885b-1e155e47775a","resolution":{"observed_at":"2026-08-07T00:33:21.412866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.384870Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"2ccbd707-c276-4aec-a24c-de1e3b74a3b2","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.297381Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:08609abd90e0a0f4ab16143f0a56d887b49884e308d832bb43b0b69dbeb512c2","observation_id":"162c306d-abff-46dd-a029-c6edbdfa953e","resolution":{"observed_at":"2026-08-07T00:33:21.391181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-07T00:33:19.302280Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.302280Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e659752ff06d5cdba6739f288aa0a13b99c0b79987008c103d9683868d9ac1b3","observation_id":"16c684df-b327-4f82-8bb9-7e17c22b4528","resolution":{"observed_at":"2026-08-07T00:33:19.302280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.365020Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"3278c12f-e889-426b-87f3-9136e5793059","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.307062Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:45d1663766440c8138f31f42cb1769e6a3729e98a3af76ee5b1b7c718017d09a","observation_id":"2828e8b0-ff6c-4883-b663-885ba785378b","resolution":{"observed_at":"2026-08-07T00:33:21.371372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:33:19.311995Z","title":"Internvideo: General video foundation models via generative and discriminative learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.311995Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:7c5ab3647f9228fe5200270af2909d2f478b231227c8e0a31a8eeb8895c45a8c","observation_id":"90ff68e9-ab1c-4fff-90a3-784606db2304","resolution":{"observed_at":"2026-08-07T00:33:19.311995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T00:33:19.316833Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.316833Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:899cba75ff99e70fc2ae9a19178fe7beb54b7b17b13f82cf702b6d63a420c7b1","observation_id":"bd4ad7ce-5871-44c9-9b2f-0bc008ee470e","resolution":{"observed_at":"2026-08-07T00:33:19.316833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.342832Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"1df00723-8595-4660-af1b-ebfb0eb15b3f","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.321745Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:6fcac1d6e5f044722057441563b4093c30d024cbf8afa748fa4410f5b96d1406","observation_id":"aea73c1b-d24c-42f7-9447-41c286b980ea","resolution":{"observed_at":"2026-08-07T00:33:21.348872Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T00:33:19.326679Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.326679Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:336cff7f0731a879d8456043d31d8067a33ef4bf593198cb9f02a708c1a989e8","observation_id":"fa43ef72-8084-4d98-b812-6fccee3b5343","resolution":{"observed_at":"2026-08-07T00:33:19.326679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.331593Z","title":"Video-LLaV A: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.331593Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:54feb5ca99246ae3823fd02dcc13e8e4e36b618cf72c3cbe611851bf8336b5a0","observation_id":"d03987c5-bb12-41b9-896b-94b8880e4c21","resolution":{"observed_at":"2026-08-07T00:33:19.331593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T00:33:19.341323Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.341323Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:24ae459f8e4a5938bfc372f378191c3fb52aa6428c1ca55a6e423a65fccb70ff","observation_id":"e40c7e43-5d2a-4814-a945-19f891f788fb","resolution":{"observed_at":"2026-08-07T00:33:19.341323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-09T02:58:40.541098Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T00:33:19.346344Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.346344Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:71a464c82bab55d62a5e7ba0bcce97c50f8425aee8e9bc76a430dd80f6e2a37b","observation_id":"09ba4a5e-31cf-4a00-89cd-cc489715c8a5","resolution":{"observed_at":"2026-08-07T00:33:19.346344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.297239Z","title":"Slam-omni: Timbre-controllable voice interaction system with single-stage training,","venue":null,"work_id":"357c0759-0d93-470a-b148-d33a9d8886e6","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.351418Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d4b73930da7aa6e92beecac8d108cd715277caa88cb1d25251c0cd468c619486","observation_id":"a75a3f1e-d172-4cc1-a04d-c8d055653d95","resolution":{"observed_at":"2026-08-07T00:33:21.304020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.273050Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":"52b9d32f-dd65-4c21-b7a8-36da4954d971","year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.361775Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:b5649e3a7a7e6329cfd9faf5a3c074835122f85228f69571c865a5278e93d943","observation_id":"7e87629b-a43e-499e-b0e3-1baac53bd90e","resolution":{"observed_at":"2026-08-07T00:33:21.278885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-03T16:28:18.429985Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15649","snapshot_observed_at":"2026-08-07T00:33:19.356530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.356530Z"},"links":{"cited_paper":"/paper/2412.15649","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:7a00f1ea25cd12dd439888f93878e44fcf73620b1958d3844b0aec30446d61ac","observation_id":"20ba2d0d-0fac-499b-a766-14073c675d5b","resolution":{"observed_at":"2026-08-07T00:33:19.356530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.371514Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.371514Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1e8fe2fe7a6957fc4930d5c0694f234a860baca4727dec34b0fd94cccb888680","observation_id":"76a7d486-85e6-46e4-a154-e4a7113a5e5d","resolution":{"observed_at":"2026-08-07T00:33:19.371514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.366716Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.366716Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:341b871d8b29967e6e8ced6e98e540237549f634e6303e65dcabf3efb0cee775","observation_id":"364e34da-2e2e-4130-ae6e-9ecf434d071f","resolution":{"observed_at":"2026-08-07T00:33:19.366716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T00:33:19.381385Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.381385Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c5e33411597e8c7523e5685e8d7021c5666a2de5d4fc5d50de17a153caa5d918","observation_id":"40a80281-7f94-4d0c-a57c-851ee32bd298","resolution":{"observed_at":"2026-08-07T00:33:19.381385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.236669Z","title":"Speechtokenizer: Uni- fied speech tokenizer for speech language models","venue":null,"work_id":"0c44482e-6122-4383-a453-80979a1dfb33","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.376928Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:9f610d4d2c9a7b943277b34c01d22e7d833249bae23c11f78ec2165c058b0f2b","observation_id":"1393f3cc-df50-425f-a3c8-4714f50a3c8c","resolution":{"observed_at":"2026-08-07T00:33:21.255218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.390752Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.390752Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:dca5e56af1e9f28cd5c3ff2e7505c52df11c9e67ea4f7fc53988cc3455a18623","observation_id":"49e0837c-b280-4bda-9abb-ed83e6a41216","resolution":{"observed_at":"2026-08-07T00:33:19.390752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.205505Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"d08c2b02-0fd6-44fa-8d20-90d613310b80","year":2020},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.386288Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ca906661f015cf7ac168ee19c1b018520f0dfdb8dd1db51229c33f1850fc80be","observation_id":"9b572f75-01bb-4bdd-8a94-1835bf8faf8e","resolution":{"observed_at":"2026-08-07T00:33:21.212324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18778","last_updated":"2025-04-07T08:54:28Z","snapshot_observed_at":"2026-08-07T17:48:24.066835Z","submitted_at":"2025-02-26T03:21:12Z","title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18778","snapshot_observed_at":"2026-08-07T00:33:19.400418Z","title":"M2-omni: Advancing omni-mllm for comprehensive modality support with competitive performance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.400418Z"},"links":{"cited_paper":"/paper/2502.18778","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:599605cdac47a2b3da30e7bf999c477c403ce363a1f642a122cfca930ccae0a9","observation_id":"6907a3a9-4e83-4aa4-a288-2d6d4560034d","resolution":{"observed_at":"2026-08-07T00:33:19.400418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.186018Z","title":"Megrez-omni technical report, 2025","venue":null,"work_id":"febcbe8a-8eb0-48ce-8db3-57580fa3e6f1","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.395633Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ea422b8bff693bd0ae47747ffe2f053204355c1b3a52e25d014c62715caac595","observation_id":"79c360b9-12cc-47f9-8e9d-f0c67c6d7099","resolution":{"observed_at":"2026-08-07T00:33:21.191840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-03T18:53:30.527385Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-07T00:33:19.410942Z","title":"Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Jun Yao, Lanqing Hong, Lu Hou, and Hang Xu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.410942Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:f2c96a61811b322c2b5f2ce12fd2a678db84fec35197a62b61b84b68b086b35e","observation_id":"3f5707ab-84f4-4a61-aa79-9f94835d864c","resolution":{"observed_at":"2026-08-07T00:33:19.410942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12315","last_updated":"2025-04-10T07:08:53Z","snapshot_observed_at":"2026-08-07T16:06:57.674761Z","submitted_at":"2025-04-10T07:08:53Z","title":"Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models","version":1},"cited_work":{"arxiv_id":"2504.12315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12315","snapshot_observed_at":"2026-08-07T00:33:20.184355Z","title":"Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models","venue":"cs.CL","work_id":"e8d278b3-460e-43e1-ae7d-5a4f40933bd6","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.405533Z"},"links":{"cited_paper":"/paper/2504.12315","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:cbfa8bc9d70506d87710ee84ee3670b0f0af2a83fa98be178382263d4e33c461","observation_id":"49d2bc70-bf19-47eb-9c8f-432f1887f8fb","resolution":{"observed_at":"2026-08-07T00:33:20.191604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-07-06T20:21:55.366596Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09502","snapshot_observed_at":"2026-08-07T00:33:19.420806Z","title":"Omni-emotion: Extending video mllm with detailed face and audio modeling for multimodal emotion analysis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.420806Z"},"links":{"cited_paper":"/paper/2501.09502","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fe985408375b05b4e0d527fbe4856d8d13e41f965808826cc3e4dddd29cc115e","observation_id":"5f8eeb56-c015-44ca-b3ee-76677e515931","resolution":{"observed_at":"2026-08-07T00:33:19.420806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.416428Z","title":"Openomni: Advancing open-source omnimodal large language models with progressive multimodal alignment and real-time self-aware emotional speech synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.416428Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3bde34e8b1f79785ef5096853c66969c9436e72b0aa817e2d4f0a54a35524e0d","observation_id":"2337fda3-cc8c-4241-b296-8134f263461a","resolution":{"observed_at":"2026-08-07T00:33:19.416428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.430154Z","title":"Stream- Speech: Simultaneous speech-to-speech translation with multi-task learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.430154Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:5bf59130ea0e84608c91f64c4799f05bf95476f1d17660ceaffbf2a13f2954af","observation_id":"9eef4a63-d46b-45e7-b69a-d26e6226ab37","resolution":{"observed_at":"2026-08-07T00:33:19.430154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.167503Z","title":"LLaV A-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"ad52f2db-9e7b-4299-846b-8a2ef9b8e221","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.425639Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:83c11a75b6d2e73494b687ccc36b6ed483978915dbd6db3800f3421f3f939668","observation_id":"aec48e8a-01c8-456d-98c8-0c62539af473","resolution":{"observed_at":"2026-08-07T00:33:21.172880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.147483Z","title":"Future-guided incremental transformer for si- multaneous translation.Proceedings of the AAAI Conference on Artificial Intelligence, 35 (16):14428–14436, May 2021","venue":null,"work_id":"1e64d954-3717-45ea-9e63-8c2eed29c8fb","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.439367Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:bdae7b2599ba3b80f305e7c125b8aea7f6a1a1d2a6176578964acbc6eb2f0d40","observation_id":"7b3b7fc3-c782-4dd2-9b12-c42d5f2977ea","resolution":{"observed_at":"2026-08-07T00:33:21.153594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.434764Z","title":"STACL: Simultaneous translation with implicit anticipation and controllable latency using prefix-to-prefix framework","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.434764Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:720a2994f1f9cd9aecdfe32ad3b954cf18ce78bfc750d33222fd8bac5c08d43f","observation_id":"0d4c36c6-dd8c-4162-a85d-e910384fbe28","resolution":{"observed_at":"2026-08-07T00:33:19.434764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.448868Z","title":"Information-transport-based policy for simultaneous trans- lation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.448868Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:61ee73952d6d249788648a88340055772390239be4e90b95dbb96a188a0d658d","observation_id":"b886f9d2-8782-415d-98a7-ca81cdb87e1f","resolution":{"observed_at":"2026-08-07T00:33:19.448868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.581","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.686905Z","title":"Universal simultaneous machine translation with mixture-of- experts wait-k policy","venue":null,"work_id":"dc009865-0293-41ef-a1b1-332fd2f7a323","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.443755Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c78e8a76a4bd6e980cc176fc16571117612d9b3591441a41334994cec03c29ce","observation_id":"ed288ccc-6968-47fe-9e67-c6d5fdd2ceaa","resolution":{"observed_at":"2026-08-07T00:33:19.693942Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.458294Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.458294Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ee4fb7faff33d502a6d9d45790d46a16cada4377068ee6cbec1a32f814a63e37","observation_id":"030d498b-c61a-4151-8daf-91be67b987b6","resolution":{"observed_at":"2026-08-07T00:33:19.458294Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.485","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.654624Z","title":"End-to-end simultaneous speech translation with differentiable segmentation","venue":null,"work_id":"bce5a9b4-a072-445b-a30b-bbd75b9326b6","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.453507Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:6c4e0d33a7a2b44cc33ae50eec40341ab5b42816992babe03ccadbafd63dfa7e","observation_id":"cad4eaf6-cc97-4b89-922c-a8f33a02d995","resolution":{"observed_at":"2026-08-07T00:33:19.662287Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.127317Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"376b0d46-3d2d-43bf-a3a5-4d75f5a83a25","year":2017},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.467939Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:562d3fa3dbb6a90a393a5b6234a78692f517928ab75e48a4d08b734a5ac6a75b","observation_id":"9ddbca23-aa03-4346-b39c-71a5b8142f41","resolution":{"observed_at":"2026-08-07T00:33:21.133409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03370","last_updated":"2022-02-23T06:42:31Z","snapshot_observed_at":"2026-08-09T03:42:41.612429Z","submitted_at":"2021-10-07T12:05:29Z","title":"WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03370","snapshot_observed_at":"2026-08-07T00:33:19.462794Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.462794Z"},"links":{"cited_paper":"/paper/2110.03370","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:676895ba9e4da7050664ac6b4d43eb5dd091a37d09f38d0b146a0a1a33999de5","observation_id":"8b54d6d9-9aaf-4136-a244-4645ab435966","resolution":{"observed_at":"2026-08-07T00:33:19.462794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.079802Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":"9e99ca2b-d5f6-43b2-ae71-7d2a84d600f5","year":2018},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.477513Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:9799f1ed810cb8828d46addd6339cb6e5b57548b1dfe190452accbcdf828358a","observation_id":"47529764-308a-4bec-98c9-0cf8a7c46da4","resolution":{"observed_at":"2026-08-07T00:33:21.088297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.102738Z","title":"Hudson and Christopher D","venue":null,"work_id":"1102c650-90b7-48a7-9c3e-2e922170fc25","year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.472638Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:6d17209b2d71e9549db889fc0060287161fcf6b8495b36a298d623d9ca049a57","observation_id":"15dbb48e-f8d2-4abf-a228-c45ec74ff014","resolution":{"observed_at":"2026-08-07T00:33:21.109643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.037069Z","title":"Towards vqa models that can read","venue":null,"work_id":"81e666d6-87e8-49e6-a07c-278a59766f66","year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.486601Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1f9cc2687a5d2e9559c7f35ba3fe759edca23646cca95f5f2c58f779a7cee735","observation_id":"b4715a3b-9719-4bfc-8ba2-92d0d69d98ad","resolution":{"observed_at":"2026-08-07T00:33:21.044743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.059260Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answering","venue":null,"work_id":"ec3a9547-52f3-4a5a-a094-d44efc2601f7","year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.482086Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d8edc3e2bf67e79ef3e6b29dd1639ca9acefb53135a82a30fc266cbe2f017a49","observation_id":"ce3a6731-d55c-4499-acf2-7f72fe21f344","resolution":{"observed_at":"2026-08-07T00:33:21.065463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T00:33:19.496435Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.496435Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:972608443158ae7dd07a65ddb9a4d006ec0e44343b5798ffb8c8a6a9b6127cd9","observation_id":"9ab882af-001f-4b7d-9ed5-96fe76b00cae","resolution":{"observed_at":"2026-08-07T00:33:19.496435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.017140Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a67f3350-0a40-4810-9ec7-ed75e071a1f5","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.491754Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ffab239027ddf0458010e17ecadc9df0203211f38386d26d6215e4e90af7f77b","observation_id":"f8475a16-8b23-45cb-a4c0-978f7933fbb5","resolution":{"observed_at":"2026-08-07T00:33:21.023280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.998505Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"ccbbb2ea-e59d-476c-a3ca-03b00ed09c26","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.506706Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:4212397b4f6fad9dcb57d226e8d2ddbd30eb7425dfc2e095b38a40c67fedb6ec","observation_id":"6f30e2b9-f600-4094-b497-c145b6453040","resolution":{"observed_at":"2026-08-07T00:33:21.004498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T00:33:19.501199Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.501199Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:37c22900de8c18cf32f13e7600335f15fe5c9031cca9931c21ab53489d52d904","observation_id":"a170ddd9-daa1-4f37-8cb4-3e6b391b00ef","resolution":{"observed_at":"2026-08-07T00:33:19.501199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.966684Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":"6f9a871a-198e-4503-a6cb-857c2405faea","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.516384Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:cd12bc2e6d3a379fa74c6313bfd7f6a52b4f230c7c7a631e824781dd763f486f","observation_id":"0e0579f0-f8fe-4228-ad87-283cd2471329","resolution":{"observed_at":"2026-08-07T00:33:20.972598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.511589Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.511589Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:552f8d7e2992c41c7080cfde18126ca378b1961ea6078218d1dcdc3a9cb1090a","observation_id":"783463fc-6429-43de-aa46-6cdf7ab10579","resolution":{"observed_at":"2026-08-07T00:33:19.511589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.928860Z","title":"Semantic parsing on Freebase from question-answer pairs","venue":null,"work_id":"dee9d2ae-e2c1-46a7-9660-352a0468942a","year":2013},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.531289Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e0f45f716c85bd352579db64d096d2b03baacb5f1cb0db3adb2281fd1c8420b7","observation_id":"5a224011-d38c-4c0b-8e36-661891981140","resolution":{"observed_at":"2026-08-07T00:33:20.935198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.891595Z","title":"Visit-bench: A dynamic benchmark for evaluating instruction-following vision-and-language models","venue":null,"work_id":"d61b7bb3-8920-4028-a4dc-21cb4832c657","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.540625Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:eafa0e16871a2ef81617f1b2dda3cdc165f06b4e79d19f4e558d68afeb50e5b3","observation_id":"3af33f61-c3d4-48a9-bffb-067b3f7454fe","resolution":{"observed_at":"2026-08-07T00:33:20.898083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.947777Z","title":"Spoken question answering and speech continuation using spectrogram-powered LLM","venue":null,"work_id":"81e24305-8584-4cb4-91a0-770bb13b8bee","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.526568Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d825f8a2da58eed814de68e0d57f97f47334d98e919df2e87e3cecf7da2963b8","observation_id":"f5487bc2-ab3e-4bc9-b9d6-0d435ab04a66","resolution":{"observed_at":"2026-08-07T00:33:20.953856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.549650Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.549650Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:6db12ff8d410908963b43a3ec71d9c3476f08d44ad4ab8c6580b24ef937cd924","observation_id":"cf89375b-0d49-4cba-8248-1ed91245a399","resolution":{"observed_at":"2026-08-07T00:33:19.549650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.848249Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model, 2023.URL https://huggingface","venue":null,"work_id":"5df9ce69-69d2-46d1-b5a6-9962f596eacc","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.554791Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:59041922953527e492f875c2b7fcd6ff6007745b7e150b1b89947f5e15271859","observation_id":"40133eb9-41ff-4f21-979f-69e2e2a4f8ce","resolution":{"observed_at":"2026-08-07T00:33:20.854697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.828964Z","title":"Textually pretrained speech language models","venue":null,"work_id":"20315c58-e420-4e2c-b896-2f1dfc563366","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.559359Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e064022c6f137aa496fadd1de237f691afea4df20112abd2792b6ee707963036","observation_id":"f2e0cdb4-aef5-43c3-a9d0-eae9f60b6d8e","resolution":{"observed_at":"2026-08-07T00:33:20.835643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.545187Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.545187Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:2e22ce63d6db4c8416915aceebb3274dbda6239d10a5cdd8a3d4b7154ee6ac7b","observation_id":"abe7db92-287e-4465-9595-8a98817694c7","resolution":{"observed_at":"2026-08-07T00:33:19.545187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:33:19.568881Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.568881Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:9cd055301d50fa3320d14f381bbfd7c93753fcb2c60b3700a4a998f44b4f50dc","observation_id":"1cfecd7a-cb94-4f44-ba50-8e016548ba32","resolution":{"observed_at":"2026-08-07T00:33:19.568881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.573384Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.573384Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:85cfb194674ff06f79f094b57a39dd02a2dab605b3558354625ab0931455319c","observation_id":"a119a8b9-f13b-4860-8699-792aabae8383","resolution":{"observed_at":"2026-08-07T00:33:19.573384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-08-07T15:56:21.924963Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02625","snapshot_observed_at":"2026-08-07T00:33:19.577773Z","title":"Llama-omni2: Llm- based real-time spoken chatbot with autoregressive streaming speech synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.577773Z"},"links":{"cited_paper":"/paper/2505.02625","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:f8280067f1f4d26f5f02138b97405fd18a7c4d9155f1d1c442ef7dd9ea992536","observation_id":"f5e67540-2a28-4247-9b5c-61fabd5ceea5","resolution":{"observed_at":"2026-08-07T00:33:19.577773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T00:33:19.563774Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.563774Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:10a9072b85afa71491a386dd1b64a246f8dbe6e361367db225c5e72f6bc7552f","observation_id":"387faf8f-1424-435a-b860-dc09ef65783b","resolution":{"observed_at":"2026-08-07T00:33:19.563774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.586908Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.586908Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:50f57450f261772795c5cf06ae1000e4a03df0ef6500c4d38e3f493c56c91181","observation_id":"b913fec9-ae1a-4c18-bfd8-c3f2b8284f66","resolution":{"observed_at":"2026-08-07T00:33:19.586908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.591854Z","title":"does not allow traveling to the second floor","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.591854Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fa13a6779e921fb38f470bf365565a326d789f850cb15a6c938abbd53f9b8094","observation_id":"22b2724e-132d-4889-9947-a15400715054","resolution":{"observed_at":"2026-08-07T00:33:19.591854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-09T12:37:18.065852Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-07T00:33:19.582482Z","title":"Scaling speech-text pre-training with synthetic interleaved data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.582482Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:4513c56c4815180fe0a6129a74b26fc8d60f8484f632b12bce9fb16ebbb8e990","observation_id":"7d2c1a34-e4c4-48c0-b0cf-f4ee13d27e4e","resolution":{"observed_at":"2026-08-07T00:33:19.582482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.911291Z","title":"URL https://aclanthology.org/ D13-1160/","venue":null,"work_id":"a576aef2-16c3-4908-9a41-48bd34569a67","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.535826Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c105e1562143778efd2bea505d0246c597cb4aad6e058e2229e6777ab8b4a89d","observation_id":"8c062e03-716e-412a-8997-ad76e25128a1","resolution":{"observed_at":"2026-08-07T00:33:20.916950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T00:33:19.521264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.521264Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:f30ac82322ada4b5f1b37f5b5df2e7c4bf45eeb7b8fd467dd1ce92c1edd6fb2b","observation_id":"8ede076c-5894-4de9-8ed9-890ce438eb60","resolution":{"observed_at":"2026-08-07T00:33:19.521264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.336391Z","title":"doi: 10.18653/v1/2024.emnlp-main.342","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.336391Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:82b62cfd3f96995720c0244678c42f319ac3df74f09f6da836fb6ab84221c0cd","observation_id":"cba64abf-8252-40a7-9f0b-0e0ebac5daca","resolution":{"observed_at":"2026-08-07T00:33:19.336391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 5 inbound Pith citation observations for arXiv:2506.13642."}