{"as_of":"2026-08-18T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7d78eeeb4ef81fa29f648193e8192a54067e640295897d102e5587e8fd85eb0","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:58:10.657355Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:11.838092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-15T23:21:11.838092Z","title":"Ming-omni: A unified multimodal model for perception and generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.838092Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:1d003ad88163d15fac541cc337bf16427ed606030311844dfc3d99511b827f03","observation_id":"f5a44a29-2cb8-4c17-8dc1-78f83a0dfabf","resolution":{"observed_at":"2026-08-15T23:21:11.838092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-06T23:10:11.299104Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19502","last_updated":"2025-07-15T06:04:25Z","snapshot_observed_at":"2026-08-08T09:12:20.223672Z","submitted_at":"2025-06-24T10:40:23Z","title":"MATE: LLM-Powered Multi-Agent Translation Environment for Accessibility Applications","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:10:11.299104Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2506.19502"},"observation_digest":"sha256:479e996e75a5b67fa1433dfdab57ec5b6e3760912bd32ecc5b20223783517b97","observation_id":"d3abfd34-b80c-4e53-9850-34275c614d48","resolution":{"observed_at":"2026-08-06T23:10:11.299104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-08-17T15:19:50.584357Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:b0cfdddcc87ca1255a875bbb673fda1960d6f804863741d562e60f046a92cd95","observation_id":"81019c43-5f2f-4939-90ec-c12646c4b2ac","resolution":{"observed_at":"2026-05-17T20:50:15.104995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-03T15:26:12.673638Z","title":"Ming-omni: A unified multimodal model for perception and generation.arXiv preprint arXiv:2506.09344, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16978","last_updated":"2026-06-16T16:38:58Z","snapshot_observed_at":"2026-08-07T04:10:11.766593Z","submitted_at":"2025-12-18T18:59:27Z","title":"A Benchmark for Omni-Modal Reasoning in Long Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:26:12.673638Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2512.16978"},"observation_digest":"sha256:c99a822d390e1b78fa9c4ff46a869d31bc364541021fa0fa32b0572e61484296","observation_id":"59e6e5ba-9d8b-4c72-a1ef-1317b5dd4ecd","resolution":{"observed_at":"2026-08-03T15:26:12.673638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:9dc113b5a506d9dde7183119741ac4de4e0246db2b87a0076b7a63809825fea5","observation_id":"74fd0d8d-a4eb-4c6d-80d7-b164acdd6b87","resolution":{"observed_at":"2026-05-16T07:10:43.160927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2603.04415","last_updated":"2026-05-09T08:44:16Z","snapshot_observed_at":"2026-08-16T19:48:43.371128Z","submitted_at":"2026-02-04T04:13:39Z","title":"Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:25.063204Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2603.04415"},"observation_digest":"sha256:e03480d66dfe3bcbaa5a4aff6ee75aaa3cb85efd152feb60158d2f7d19710ff3","observation_id":"2d20c179-b2fc-46c8-9617-2633fc13e696","resolution":{"observed_at":"2026-05-16T08:12:35.432613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:751e5e04b2068b850907971fa4d559462551673b18b6048646a6486908a094ed","observation_id":"69f0c9b0-bad1-475f-857c-98595b03aa46","resolution":{"observed_at":"2026-05-11T08:30:56.929867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:10:03.707886Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:c8aafa891f61804797c0e18649315c2360463f1d24cd8bc6f8e037d6d7c98176","observation_id":"761672d4-f70a-472c-9291-12db54bc66cc","resolution":{"observed_at":"2026-05-10T14:10:28.289867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-07-12T21:18:46.566338Z","title":"Ming-omni: A unified mul- timodal model for perception and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T21:18:46.566338Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:eadb76ff456a9aadfad5f97d34cdc3cd49224cca428cbde2fb8af5e9903cf90c","observation_id":"c9f1329d-81bd-4abe-9103-0004a9efcaa5","resolution":{"observed_at":"2026-07-12T21:18:46.566338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-14T06:53:31.710132Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:3542a30b956f2e5dff2772f484911a96e5f645e5114d2f3ab1fc365bac70f9fe","observation_id":"9ab75913-f338-49f0-aab7-c3e6c54e60dc","resolution":{"observed_at":"2026-05-10T12:10:22.069624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-10T23:36:15.762831Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:49f196b9db3c81bd9742b569d8c2e88775c7992dc28235209622d4154a1ae544","observation_id":"61e884c7-de6c-4fe5-b20f-6fa77e4eefd9","resolution":{"observed_at":"2026-05-10T07:11:53.701157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-08-16T05:47:41.086994Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:6597a938c4bb2cbad10babdaae9b7f6f26d34d2d768e1e0e3f401ac837358689","observation_id":"acd9c863-5d3b-4c7f-bc21-31b756b26a82","resolution":{"observed_at":"2026-05-11T14:21:04.985281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-08-15T05:33:19.595727Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:fd7584af890ae05fedc01e6c2ac6d5289c8c8b54d426c7ea78b3962307874137","observation_id":"d2be920c-3348-412f-aa57-6314db1164f4","resolution":{"observed_at":"2026-05-11T21:41:13.497655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-08-16T06:10:46.050322Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:f61aeff9b829519dc2d5ad29da0fdcaa62bd279327d11492ea8467d6d56e5700","observation_id":"6e5184cd-82a6-4083-9a34-8a156e5a6c1b","resolution":{"observed_at":"2026-05-11T17:06:04.247249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.10501","last_updated":"2026-05-11T12:58:25Z","snapshot_observed_at":"2026-08-17T03:27:36.703529Z","submitted_at":"2026-05-11T12:58:25Z","title":"Accelerating Compound LLM Training Workloads with Maestro","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T05:11:46.845356Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.10501"},"observation_digest":"sha256:009eb5564f90e4f646cae50f8849ca5bb0ab32d0448224a630e697d98ce3151d","observation_id":"befb3024-ca75-409d-a5ed-cdabcf8ad0aa","resolution":{"observed_at":"2026-05-12T05:31:25.597147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-08-18T05:57:50.878191Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:1d9e6003f404dd8271398285ea3aea9610e5e9d3b5ff188593d9dfcd06d36d8e","observation_id":"d8a9558d-9a54-4723-b445-58b8bf5b836e","resolution":{"observed_at":"2026-05-13T04:52:16.317482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.16403","last_updated":"2026-05-13T05:00:19Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T05:00:19Z","title":"When Vision Speaks for Sound","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T22:12:52.160596Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.16403"},"observation_digest":"sha256:6a4a5b65038723696ef41c4e9bef5fd38166255f9e64350535701e5b317ce7f5","observation_id":"a59024a1-6a22-4c83-b3f2-a717820d62e9","resolution":{"observed_at":"2026-05-20T22:13:46.891952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-17T02:34:31.797934Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:05249fdf50fb58b8865964e0c3d30f14d92c8984ee25edf92ffb90197d611b1f","observation_id":"f9ee4736-29c4-4eb7-a044-59007715992e","resolution":{"observed_at":"2026-05-22T09:26:20.784211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:4122f9a62ed27f10a6d8b549c84cec0cfc09101a2ddbbd06b5b7afd640de240a","observation_id":"c38594da-f5fd-434a-8324-fb58ef1d8085","resolution":{"observed_at":"2026-06-29T23:04:02.008433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.27918","last_updated":"2026-05-27T03:44:27Z","snapshot_observed_at":"2026-08-13T15:53:00.896578Z","submitted_at":"2026-05-27T03:44:27Z","title":"Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T10:20:12.860927Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.27918"},"observation_digest":"sha256:9250727a257640588b782d994a56f694a1ce8dd42231f7d70e43f0a8268258dc","observation_id":"df39790b-feea-4da2-bf12-88b636dfa4a9","resolution":{"observed_at":"2026-06-29T10:23:18.014835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-17T08:21:54.606667Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:24f3cac005abcb970173b4f4eb8c553ab35a8aaa697dae993f7ec04a46fbd4ce","observation_id":"d996737e-1647-4160-bc43-d7ba78b8ea99","resolution":{"observed_at":"2026-06-29T13:03:26.238741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-12T21:07:03.038294Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:02d6ae5b44f65d0edada6ee5636de803d2dcb9c34f5b8bb6c0389467ee87bb5d","observation_id":"3b14cc91-248a-4b17-a5c9-f6a3c32c0e3e","resolution":{"observed_at":"2026-07-01T19:16:00.560543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-08-13T15:48:57.500872Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:b40a66ed94527896f32ea20735895cdb62068ed159b0cd80309cd7f808bc656c","observation_id":"08c308ba-da7e-4407-9d0a-15ed987b1931","resolution":{"observed_at":"2026-06-28T17:52:27.077528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:7f7a10446aaa68fa3b8034e34842d7f206516e6f9be8712477bfebfd91a48a25","observation_id":"02327fc4-30ea-44bc-9b36-2beebe1677fc","resolution":{"observed_at":"2026-07-02T17:37:14.025507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:446b9b0fd518189ebc80ce95134c821f8f6bc1dd3e55556eda668f429fa572d7","observation_id":"ee1207c0-46e7-4a8e-ab52-f27799133443","resolution":{"observed_at":"2026-07-04T03:49:30.273485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.22983","last_updated":"2026-06-22T08:04:12Z","snapshot_observed_at":"2026-08-13T19:15:54.888323Z","submitted_at":"2026-06-22T08:04:12Z","title":"LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:07.356352Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.22983"},"observation_digest":"sha256:159c6028724a3ddc075275c88c8bc79ef19c91ba8ef9be574c77dafc629efaca","observation_id":"90f74144-9e31-4f1f-aa25-c288041dabe8","resolution":{"observed_at":"2026-07-04T11:59:50.658325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-08-17T00:39:07.624929Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:81759e9160bef4cbab498a0acab72f54bc525083e2ed97dea917726bad859ecf","observation_id":"6d083d17-7830-4795-8cfb-bb967d85bd16","resolution":{"observed_at":"2026-07-04T11:59:50.906567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-08-14T12:28:23.502257Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:47a22edbbae9a54501414ea04b1541141e735a4f2a69c6c349f5746c3e5f1d9d","observation_id":"0bf63540-2e1d-4b51-a92a-1afe5db3e18e","resolution":{"observed_at":"2026-07-04T13:59:52.826743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-04T20:58:27.262829Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01785","last_updated":"2026-08-03T06:59:15Z","snapshot_observed_at":"2026-08-15T19:40:12.543019Z","submitted_at":"2026-08-03T06:59:15Z","title":"HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:27.262829Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2608.01785"},"observation_digest":"sha256:facecd5cfb3cea98fd793c8c45a05a69980c98b09fd20e9a75c6e713d419ae55","observation_id":"2dc81df9-a333-482f-b9d6-c0138f50139a","resolution":{"observed_at":"2026-08-04T20:58:27.262829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-10T18:47:42.569068Z","title":"Jaeyong Kang and Dorien Herremans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-18T16:47:00.622695Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.569068Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:89376263392705cbfc6c7c039c7bbc725a7732061e9b6d3a0ba8904bb2369fc3","observation_id":"50206a3c-3d6f-47da-8401-f85120f2b15a","resolution":{"observed_at":"2026-08-10T18:47:42.569068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09344/citation-record","integrity":"/paper/2506.09344/integrity","json":"/paper/2506.09344/citation-record.json","paper":"/paper/2506.09344"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T04:58:06.798089Z","title":"Seed-tts: A family of high-quality versatile speech generation models.CoRR, abs/2406.02430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.798089Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f08910c6be2d4d6ac1535508cb7967914e67a740dd32d58a5dc389fcd4c3379a","observation_id":"97c7ba52-f118-4652-bb40-c2f3d27a5a33","resolution":{"observed_at":"2026-08-07T04:58:06.798089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T04:58:07.024845Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.024845Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8a0d5e068b5926ec2a856873162d7efbc798e54a6b68b6b6e09c4e0a78a5fcdc","observation_id":"c3067baf-60f0-4653-b297-95bb30c869df","resolution":{"observed_at":"2026-08-07T04:58:07.024845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04938","last_updated":"2017-06-13T22:48:53Z","snapshot_observed_at":"2026-08-14T21:39:35.517738Z","submitted_at":"2016-09-16T08:14:50Z","title":"Image-to-Markup Generation with Coarse-to-Fine Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04938","snapshot_observed_at":"2026-08-07T04:58:07.289619Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.289619Z"},"links":{"cited_paper":"/paper/1609.04938","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:feb7095432c480639770efcfdb3cfbf4712505e6864ce3a4605d9883142957c5","observation_id":"682af26a-c8b6-492e-ba35-32edade64f8a","resolution":{"observed_at":"2026-08-07T04:58:07.289619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:07.341301Z","title":"Chaoyou Fu, Y uhan Dai, Y ondong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Y unhang Shen, Mengdan Zhang, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.341301Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:15a6716544519a747c5d8f743b8b6cb735953e5def31b09ad4637a727a681f08","observation_id":"374d689e-3863-4d1c-8886-b7d8710bd148","resolution":{"observed_at":"2026-08-07T04:58:07.341301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-16T17:41:04.946563Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T04:58:07.524656Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage.arXiv preprint arXiv:2111.09344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.524656Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:cdeb757e38bd7824779c20e8e516b6461f327c039a63909d606b3de28e174e1c","observation_id":"007423dc-82e9-40c5-be88-0607471da412","resolution":{"observed_at":"2026-08-07T04:58:07.524656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-18T07:30:25.553997Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-07T04:58:07.617554Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit, 2023.https://arxiv.org/abs/2305.11013","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.617554Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:a29e0dd7b5241f66b5c4873a92691b671f66393269eaef35b5c37a93dfc2e29b","observation_id":"70a0d441-835b-48cb-9407-933b084066dc","resolution":{"observed_at":"2026-08-07T04:58:07.617554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18778","last_updated":"2025-04-07T08:54:28Z","snapshot_observed_at":"2026-08-16T12:55:09.792048Z","submitted_at":"2025-02-26T03:21:12Z","title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18778","snapshot_observed_at":"2026-08-07T04:58:07.736425Z","title":"M2-omni: Advancing omni-mllm for comprehensive modality support with competitive performance.arXiv preprint arXiv:2502.18778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.736425Z"},"links":{"cited_paper":"/paper/2502.18778","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:0692a62cb7509edb1e62986d1b5d22b349c87fb2392fec2accca10f1d973957e","observation_id":"fa731db0-4fbb-40fc-9444-209b2dd5062e","resolution":{"observed_at":"2026-08-07T04:58:07.736425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T04:58:07.970950Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.970950Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:7890f98dc68182e21a7947e6b3a5921307bd03e8e4f50a5136f1c2cc4ef0dbc5","observation_id":"608617b7-2ee3-443b-8385-e8a2114b71e8","resolution":{"observed_at":"2026-08-07T04:58:07.970950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-07T04:58:08.031807Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction, 2025.https://arxiv.org/abs/2505.02471","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.031807Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:d3c927f029ef380352d0cbeae6237356dec93c8940e4ba9a5d2e14bab33f393d","observation_id":"852eed35-e376-4708-b0b5-c93c3bc3d385","resolution":{"observed_at":"2026-08-07T04:58:08.031807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03929","last_updated":"2022-10-08T05:49:05Z","snapshot_observed_at":"2026-08-18T15:11:16.529587Z","submitted_at":"2022-10-08T05:49:05Z","title":"EgoTaskQA: Understanding Human Tasks in Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03929","snapshot_observed_at":"2026-08-07T04:58:08.132037Z","title":"Wei Kang, Xiaoyu Y ang, Zengwei Y ao, Fangjun Kuang, Yifan Y ang, Liyong Guo, Long Lin, and Daniel Povey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.132037Z"},"links":{"cited_paper":"/paper/2210.03929","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9defd1835ebad82c5c2ffae7a34bad8ab41f0c10e10de3222d8b30c48902b21a","observation_id":"c10826b0-b811-4ac8-848d-710487f0c234","resolution":{"observed_at":"2026-08-07T04:58:08.132037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12241","last_updated":"2023-12-19T15:25:39Z","snapshot_observed_at":"2026-08-17T08:08:13.643438Z","submitted_at":"2023-12-19T15:25:39Z","title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12241","snapshot_observed_at":"2026-08-07T04:58:08.217484Z","title":"Geomverse: A systematic evaluation of large models for geometric reasoning, 2023.https://arxiv.org/abs/2312.12241","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.217484Z"},"links":{"cited_paper":"/paper/2312.12241","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:4ef8a3ad419668c5244b3517c0722b4a63c1275c5da442f0cdbac44afca93f5d","observation_id":"1d6e47b9-39d2-47d4-8707-2ace687eb27f","resolution":{"observed_at":"2026-08-07T04:58:08.217484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05139","last_updated":"2025-03-10T14:21:21Z","snapshot_observed_at":"2026-08-16T12:52:17.388517Z","submitted_at":"2025-03-07T04:43:39Z","title":"Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05139","snapshot_observed_at":"2026-08-07T04:58:08.521682Z","title":"doi: 10.18653/v1/2024.naacl-long.392.https://aclanthology.org/2024.naacl-long.392/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.521682Z"},"links":{"cited_paper":"/paper/2503.05139","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:781ac4671834c12c59fb384ee5411ccbf6605c027f59e0b037b88cbb60c38e64","observation_id":"45760fc5-91b9-4438-85c6-7bc341c48d89","resolution":{"observed_at":"2026-08-07T04:58:08.521682Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09542","last_updated":"2021-02-18T18:44:50Z","snapshot_observed_at":"2026-08-16T18:44:36.581805Z","submitted_at":"2021-02-18T18:44:50Z","title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09542","snapshot_observed_at":"2026-08-07T04:58:08.699216Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering, 2021.https://arxiv.org/abs/2102.09542","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.699216Z"},"links":{"cited_paper":"/paper/2102.09542","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:e6f45116170e804835485135fc8a4dab636553ffb5629667e8ab0de9498d4325","observation_id":"241556af-9e91-45bc-b9e4-46a607fba19f","resolution":{"observed_at":"2026-08-07T04:58:08.699216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-acl.177.https://aclanthology.org/2022.findings-acl.177/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.682796Z","title":"doi: 10.18653/v1/2022.findings-acl.177.https://aclanthology.org/2022.findings-acl.177/","venue":null,"work_id":"436222f5-bcd7-4b1b-b381-bac55dea020e","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.892938Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:7dd3800b18b810858f67731989b83dbaabd2ed2ef48e85475b53364020319c89","observation_id":"37d6edeb-42af-4c5b-a1e8-f2372a242aa4","resolution":{"observed_at":"2026-08-07T04:58:10.687629Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:09.033058Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.033058Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:88826712621d01e3e22e5368901345f5f74ac56f887b5db0d638acbdb9727370","observation_id":"ac6a8a02-1cf9-4fc5-ba9e-97f7ff1cced6","resolution":{"observed_at":"2026-08-07T04:58:09.033058Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07626","last_updated":"2025-03-25T06:19:32Z","snapshot_observed_at":"2026-08-15T15:31:36.046464Z","submitted_at":"2024-12-10T16:05:56Z","title":"OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07626","snapshot_observed_at":"2026-08-07T04:58:09.094956Z","title":"Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.094956Z"},"links":{"cited_paper":"/paper/2412.07626","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f77a0cdc2525ac1159358a162ad2d79d6b33360f63f8223933c485d450838f0a","observation_id":"46ecc3aa-3986-4892-9349-3a8f625cc6e7","resolution":{"observed_at":"2026-08-07T04:58:09.094956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T04:58:09.209905Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.209905Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8e5049e5e990e844f3b02dbdb36029da445b125c7bbf0870e0cc5adfd7a04723","observation_id":"f2333b94-35d2-4b2f-a9d0-565eff4f8b12","resolution":{"observed_at":"2026-08-07T04:58:09.209905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-08-15T16:45:09.638988Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T04:58:09.373118Z","title":"Mls: A large-scale multilingual dataset for speech research.arXiv preprint arXiv:2012.03411,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.373118Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:662f73bdf1005129d26a4d58337855851dc66a0424883d3dbd17f48173f0a330","observation_id":"7eafccbb-e235-443d-8afd-81a331039c9e","resolution":{"observed_at":"2026-08-07T04:58:09.373118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T04:58:09.513337Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.513337Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f5346dc2481aea9925d6ed0cae085a12d5c4369d861682d0eaeb00b2313a4167","observation_id":"f69c249c-b6b3-444c-90c8-e4e86784bdca","resolution":{"observed_at":"2026-08-07T04:58:09.513337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:58:09.654968Z","title":"Cinepile: A long video question answering dataset and benchmark, 2024.https://arxiv.org/abs/2405.08813","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.654968Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:c25d91ac11bc9120d7430fe0cf21d53fba91529db4d9d2e72807c8cfb3a50f0e","observation_id":"bf3a7020-ca82-45ec-a2de-6bcdbce815e5","resolution":{"observed_at":"2026-08-07T04:58:09.654968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-07T04:58:09.864477Z","title":"Christoph Schuhmann, Romain Beaumont, Richard V encu, Cade Gordon, Ross Wightman, Mehdi Cherti, Theo Coombes, Aarush Katta, Clayton Mullis, Mitchell Wortsman, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.864477Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9103200c7e9239ec9f48d2886b54be9e4248c4db591a852648942b9634cac519","observation_id":"c07e59de-411a-49eb-bf6f-bea0b08dda42","resolution":{"observed_at":"2026-08-07T04:58:09.864477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.611811Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"0baf2ea6-0b48-4bbc-b7f4-a81bc8f027d8","year":2015},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.991644Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:673922dc3c357ff90bf7583dfdfc606397e92b049182583f41b3dd6deb7a6c3b","observation_id":"d59c8a55-e419-462d-96a2-21ec867793db","resolution":{"observed_at":"2026-08-07T04:58:11.694092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T04:58:10.204457Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.204457Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:6210afc6388f8d23768d238eae3fcd683a47343bb7e5a7fe39b3198d46514ac8","observation_id":"9789e5df-5103-4315-9e4b-142f38f3933b","resolution":{"observed_at":"2026-08-07T04:58:10.204457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.01320","last_updated":"2020-06-09T19:24:52Z","snapshot_observed_at":"2026-08-06T23:26:52.451979Z","submitted_at":"2020-02-04T14:35:28Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","version":2},"cited_work":{"arxiv_id":"2002.01320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.01320","snapshot_observed_at":"2026-08-07T04:58:10.887678Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","venue":"cs.CL","work_id":"d425c91e-f309-4da9-80f1-ac230200c582","year":2020},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.339655Z"},"links":{"cited_paper":"/paper/2002.01320","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:c55e3dfcd3a544f9e44550797976427de3532b162de9b5b2e37a230563a0c28e","observation_id":"b49d0d64-18d9-4b4d-8235-aa46a9201558","resolution":{"observed_at":"2026-08-07T04:58:10.891623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.428391Z","title":"Slidespeech: A large scale slide-enriched audio-visual corpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.428391Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:88359fbcd9473f4cd4bd711b1908ef2f621273c456cd75cd3db7071c30e41d32","observation_id":"32ca496a-6bf1-4228-b6be-b1ab8a8463ec","resolution":{"observed_at":"2026-08-07T04:58:10.428391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-12T18:02:58.527813Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-07T04:58:10.542544Z","title":"Os-atlas: A foundation action model for generalist gui agents, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.542544Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9fe2438ed14b682ea1b7948922cf26ef56f8facee657ab5bda17c00925fd455e","observation_id":"36a390e8-a972-421e-8826-460332d0dfae","resolution":{"observed_at":"2026-08-07T04:58:10.542544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.633339Z","title":"ISBN 9798400701085","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.633339Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:41727c9d5f9cd486fb66a9f13930d7554c1d19bcd97af262e3af5341e83ab32f","observation_id":"a82d713d-511c-41f1-8255-6d2bf0604a2a","resolution":{"observed_at":"2026-08-07T04:58:10.633339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T04:58:10.636410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.636410Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8a5045a7ae074b6fb0968717a22367a55156e4e432b3d5374661e4591f789fc4","observation_id":"4bb92906-f6d6-4b38-a808-d40f05bc41ba","resolution":{"observed_at":"2026-08-07T04:58:10.636410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-08-16T13:44:40.227891Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-07T04:58:10.639605Z","title":"Vript: A video is worth thousands of words.arXiv preprint arXiv:2406.06040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.639605Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:bfc714f7ec561c9382ca58b3edf34178b59db4e3455d24656a28032813835555","observation_id":"049d0006-7368-460b-a253-3cfe11c2066f","resolution":{"observed_at":"2026-08-07T04:58:10.639605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T04:58:10.642605Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.642605Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:d7b20e5e53ef8ddaf57a1eb63d16f7d9763967e858d5a4896b9a90dce4f4f3dc","observation_id":"1f598556-2f20-496f-b72b-02e98b4cf9ad","resolution":{"observed_at":"2026-08-07T04:58:10.642605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.515595Z","title":"Fan Y u, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Y an, Bin Ma, Xin Xu, and Hui Bu","venue":null,"work_id":"2ee0f4af-129c-4115-ac31-cd7fea6154ec","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.645410Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:3572e15dfe99a48fe28332b66a80e209a5f477b29ec8342f39b2424c6a403421","observation_id":"41c20c2a-d8e2-49e7-88b9-94142f01a28d","resolution":{"observed_at":"2026-08-07T04:58:11.532420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.476590Z","title":"Icdar 2023 competition on structured text extraction from visually-rich document images,","venue":null,"work_id":"27dd52c0-b252-4cc4-b5e4-afbdfd7bfc44","year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.648677Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:c4bbb12de34e64168ee6df6421b8632e7fb0653de66f7f41ed672d8a7609ec14","observation_id":"9e141403-3595-47f2-9a8b-2d1e9bd1a02a","resolution":{"observed_at":"2026-08-07T04:58:11.488768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03287","last_updated":"2023-06-05T22:20:52Z","snapshot_observed_at":"2026-08-16T15:26:21.556086Z","submitted_at":"2023-06-05T22:20:52Z","title":"ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich Document Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03287","snapshot_observed_at":"2026-08-07T04:58:10.651374Z","title":"Albert Zeyer, André Merboldt, Wilfried Michel, Ralf Schlüter, and Hermann Ney","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.651374Z"},"links":{"cited_paper":"/paper/2306.03287","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f2882a2aa5f6326eefa07bfbfc64d027d74ee0dca2c1335f9dc5647a6b1efeb4","observation_id":"53a379cc-53de-4149-a087-873789b7006f","resolution":{"observed_at":"2026-08-07T04:58:10.651374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03370","last_updated":"2022-02-23T06:42:31Z","snapshot_observed_at":"2026-08-16T17:51:10.961289Z","submitted_at":"2021-10-07T12:05:29Z","title":"WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03370","snapshot_observed_at":"2026-08-07T04:58:10.654286Z","title":"WENETSPEECH: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.654286Z"},"links":{"cited_paper":"/paper/2110.03370","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:76fcda01d5b61349be31438135b2ae122d365019ffb30a36d4b73851c9365018","observation_id":"19cd9c47-a240-4442-9e8b-0599fd5ce481","resolution":{"observed_at":"2026-08-07T04:58:10.654286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.441851Z","title":null,"venue":null,"work_id":"cdf66757-6231-40bf-9ff4-e1ea6ee5d6de","year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.657355Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:90d1460965c413205235615b590f9a3d3a853c910535928c9ccc4ae57a0edfbb","observation_id":"4defd50b-aaff-4b29-9951-93ad0d5ea30d","resolution":{"observed_at":"2026-08-07T04:58:11.450100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-16T14:18:27.107802Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T04:58:09.750924Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.750924Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:581e14dcb0e43b1d5d774625e0253a940ea9cbb966231652be47f943874e2d2d","observation_id":"9d290ed7-dc77-45a3-b4e6-29d20b1418fa","resolution":{"observed_at":"2026-08-07T04:58:09.750924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T04:58:08.350784Z","title":"doi: 10.3115/v1/D14-1086.https://aclanthology.org/D14-1086/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.350784Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:a4ef88dacbc6829a4265563c68985b64b78317b81d7898fbef30af07cf448f3d","observation_id":"d2e49b1d-b157-49f3-9bcf-4b9f40b7fff0","resolution":{"observed_at":"2026-08-07T04:58:08.350784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d15-1171.https://aclanthology.org/d15-1171/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.976784Z","title":"doi: 10.18653/v1/D15-1171.https://aclanthology.org/D15-1171/","venue":null,"work_id":"50be67c6-b12d-4344-b7c1-7409b0e9c285","year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.103677Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:dfdefe868d022b7f1788d1f97badf6f02c7b19e093d3051959529ba0c3a64e4e","observation_id":"87b56999-0a42-4485-8fba-9bd04296c0b8","resolution":{"observed_at":"2026-08-07T04:58:10.979960Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:08.785940Z","title":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.785940Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9d0b4d85cf3d38102d80f1111974ce8dae80713281483f8d6a46daa691186a12","observation_id":"63b21592-3895-4dd0-b2c3-1a91ca1766ec","resolution":{"observed_at":"2026-08-07T04:58:08.785940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:08.412448Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area, 2025.https://arxiv.org/abs/2408.07246","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.412448Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:b04a5455361c5954399b281b7919e2bc4db33a69ee260ff1def4a131cb6a5434","observation_id":"df7893b3-3daa-45b7-9005-e5980e6ac6e0","resolution":{"observed_at":"2026-08-07T04:58:08.412448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-16T16:10:44.189376Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T04:58:07.001154Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression, 2022.https://arxiv.org/abs/2212.02746","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.001154Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:6efebb94b5b1d1f3850d44ad1fb3624c25b272ad5cbb029c428be81f7045c9e4","observation_id":"8e9975ef-c8b3-42a2-a663-b1273312b613","resolution":{"observed_at":"2026-08-07T04:58:07.001154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.794728Z","title":null,"venue":null,"work_id":"a1972c99-da9b-4944-b6d0-084dd8f427f4","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.958681Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:06ed01760b5b1129ae99d0c6dc3240fa48543a5081224d7700f221fe916ad60c","observation_id":"96fbd220-840b-4192-b178-0abc448886f6","resolution":{"observed_at":"2026-08-07T04:58:11.904982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T04:58:07.163409Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.163409Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:118c81d22cd8a3380952abcad59227fc3d4b3f12e0e5d17cc5b6c5c6cc43a379","observation_id":"414aa10c-dfc5-4e9a-aea4-45c25b413918","resolution":{"observed_at":"2026-08-07T04:58:07.163409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:58:06.891957Z","title":"Qwen2.5-vl technical report, 2025a.https://arxiv.org/abs/2502.13923","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.891957Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:e207deb3f66fbadfff4a815b7eceb061d73f8ae2186b23ab7506c387ae3d5806","observation_id":"7bf8485e-b10a-48ca-b658-b84698963118","resolution":{"observed_at":"2026-08-07T04:58:06.891957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-16T13:36:26.053658Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T04:58:07.862140Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation, 2024.https://arxiv.org/abs/2407.05361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.862140Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:58cb42d5795707e376335a29b468c894c87b5bd6d4b003121026cdfe94c62b2b","observation_id":"619ad11f-4d92-493b-ac30-edf1ab09139c","resolution":{"observed_at":"2026-08-07T04:58:07.862140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":5,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 30 inbound Pith citation observations for arXiv:2506.09344."}