{"as_of":"2026-08-06T22:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:764c1d45ac1a6fca01b9a8a1c2f18abdf9b3f848bf7f969df33ac56655fd283e","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:12.567839Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:12:38.454127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T17:42:26.143560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-07-13T23:27:58.971096Z","title":"OmniEval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs.arXiv preprint arXiv:2506.20960, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16859","last_updated":"2026-07-01T09:16:52Z","snapshot_observed_at":"2026-07-13T23:27:58.053645Z","submitted_at":"2026-03-17T17:58:44Z","title":"SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:58.971096Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2603.16859"},"observation_digest":"sha256:84f7e4685ef5334dc1c07cda70527f1dfc4422500532c541f763ac7d29bf2aec","observation_id":"2730f9b8-4354-44bb-b738-6016ba2b65de","resolution":{"observed_at":"2026-07-13T23:27:58.971096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":"2506.20960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-06-28T17:42:26.143560Z","title":"Omnieval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs","venue":null,"work_id":"1e6d7b36-f4ce-4ab1-a702-dd78efd24a0e","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:1a125a2ceb9cea9b30ba9f5f4899574e2880084b9ce4ccf265f0383a7b0bf66c","observation_id":"db3424f7-a96b-489d-bee4-18522e05b557","resolution":{"observed_at":"2026-05-11T04:15:56.078287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":"2506.20960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-06-28T17:42:26.143560Z","title":"Omnieval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs","venue":null,"work_id":"1e6d7b36-f4ce-4ab1-a702-dd78efd24a0e","year":2025},"citing_paper":{"arxiv_id":"2606.00959","last_updated":"2026-05-31T02:29:36Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T02:29:36Z","title":"Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T17:40:30.038337Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2606.00959"},"observation_digest":"sha256:a874ac5b5c27d4d037bb67051d581fa1f5fa0fe5fe0b3c78c4e32494bbd0d69a","observation_id":"c5e4067b-2c44-4678-a1c2-06322a667f58","resolution":{"observed_at":"2026-06-28T17:42:26.145281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-08-02T03:12:38.454127Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-06T10:03:15.388012Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.454127Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:92b6128fe5e05ee7118328e1cdfeaf02d4e7c1ca936a551cf4feccbf44d2bba8","observation_id":"cb12b0a5-33cd-4e82-98f0-de806c00ccc2","resolution":{"observed_at":"2026-08-02T03:12:38.454127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20960/citation-record","integrity":"/paper/2506.20960/integrity","json":"/paper/2506.20960/citation-record.json","paper":"/paper/2506.20960"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.734883Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.734883Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4703e29f9f43c5d07667e0edc7e34c51731f96df6ded1a9c1a30c13ada214866","observation_id":"f225cebc-1161-439d-8716-a5d59df990eb","resolution":{"observed_at":"2026-08-06T22:41:06.734883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.473154Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"70ae398a-3099-491b-8167-a932dfc6512c","year":2015},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.815550Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c35bde5563622e72df4579319bbdb53e3f463d00aa7f83336f0fc6d04049c92f","observation_id":"5e2366f1-1b8a-42b4-9d74-84e83b6181e8","resolution":{"observed_at":"2026-08-06T22:41:16.535302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.303675Z","title":"From pre-training to fine-tuning: An in-depth analysis of large language models in the biomedical domain","venue":null,"work_id":"afc519fd-c7d0-4c02-bcce-21076e6c9ebc","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.894106Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:b8c67804df0b509700f6ee9dca8b76dbc5f2b8847ede4210f65289a9bf38a3fd","observation_id":"1d587128-15c0-4c15-810d-3476be033fec","resolution":{"observed_at":"2026-08-06T22:41:16.366029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.985286Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.985286Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9b482024736658aafa34c143722d31c6da8d266fe8ec5ff647b5cfe2490c7446","observation_id":"cd096af0-f108-46e6-9c71-25011fc1ec36","resolution":{"observed_at":"2026-08-06T22:41:06.985286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-06T22:41:07.070388Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.070388Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:0bc2416839abd51313f79a8c29c57f0a1eef1fee4813dd66d0e079f58d8cacef","observation_id":"f0c1fecd-0d5e-46e2-96fd-1bf79aa69b5e","resolution":{"observed_at":"2026-08-06T22:41:07.070388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-07-06T11:18:44.145746Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T22:41:07.185729Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.185729Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9ef6b23327a55b99c02be6d5578a26ec88872e91d42649da5c219e48935f0be8","observation_id":"beb48705-2f65-4847-94ff-a778753b0bd1","resolution":{"observed_at":"2026-08-06T22:41:07.185729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08379","last_updated":"2018-05-30T09:15:57Z","snapshot_observed_at":"2026-07-06T06:24:56.718110Z","submitted_at":"2018-02-23T04:06:38Z","title":"EmotionLines: An Emotion Corpus of Multi-Party Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08379","snapshot_observed_at":"2026-08-06T22:41:07.259689Z","title":"Emotionlines: An emotion corpus of multi-party conversations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.259689Z"},"links":{"cited_paper":"/paper/1802.08379","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:0f928f878e6368ddf5c2f1651e9b401a2591b3356d35f7d8df3bfc61b2218b82","observation_id":"98545770-40e3-4b0b-bc3c-91bc9998f5e0","resolution":{"observed_at":"2026-08-06T22:41:07.259689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:41:07.346165Z","title":"VideoLLaMA 2: Advanc- ing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.346165Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6e82984a0bb05754d97e2229e2439f64e327c70f9d7d0f3f7a4e0dca8aad0c3d","observation_id":"b275f25c-94bb-4ada-ab5e-4bd3a85d5e37","resolution":{"observed_at":"2026-08-06T22:41:07.346165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T22:41:07.424327Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.424327Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9a1db72d8fad31d4c51decdf6953867471d6673685f4b39677429bb7a06d7aa7","observation_id":"a666ecfd-3861-4c73-84bc-c7c195e80402","resolution":{"observed_at":"2026-08-06T22:41:07.424327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:41:07.513119Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.513119Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:14ec4f11ba9c57be8b0e9ce5e4e9a0d28100a076a5da8da7c2e5701a92539825","observation_id":"d1b67d40-cf4b-446a-8d72-87c15ab0214b","resolution":{"observed_at":"2026-08-06T22:41:07.513119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.133211Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech, 2022","venue":null,"work_id":"862a7f91-c62c-4b5c-862c-160095301559","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.564476Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:83dca53585260b43dd45bffa56467fb7e59f73d806d322f4c2871a4731f2df64","observation_id":"683b0b58-bb8b-431d-a76c-cfc12a45be5f","resolution":{"observed_at":"2026-08-06T22:41:16.225901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.676280Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.676280Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a5c35a7c119d3c2fb1577a3d5858875ddf731204c763f4409ff184af853b54e0","observation_id":"4ab4286a-3fb9-438e-aa33-a05606cd76c0","resolution":{"observed_at":"2026-08-06T22:41:07.676280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.982568Z","title":"Finevideo","venue":null,"work_id":"92093145-585d-477a-bdc3-751ae5d0aa97","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.761731Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:17da543548ccc58c124361efaf5c7aa802d53466e78ff6932c98a9e495101343","observation_id":"3a5efb7c-427e-43b3-8172-acffd2c5344a","resolution":{"observed_at":"2026-08-06T22:41:16.029585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:41:07.861174Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.861174Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f65e27adc4bfa0d6ea8fa66f189817ead87660a429d79bad793ac761a464339f","observation_id":"f7ebc80b-8bb9-418e-8453-3897aa102aad","resolution":{"observed_at":"2026-08-06T22:41:07.861174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T22:41:07.943880Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.943880Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:2e5fa99af8c1dd6634e72221505d16ecec7ecb6f18ea13354d650e4ac2e0f0fa","observation_id":"92ec66cc-80e7-40c1-ab3b-b1c9d3761695","resolution":{"observed_at":"2026-08-06T22:41:07.943880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-07-06T19:58:57.119904Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19772","snapshot_observed_at":"2026-08-06T22:41:08.047046Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.047046Z"},"links":{"cited_paper":"/paper/2411.19772","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:b055641e588afa31f450290a9590941ea2b896193c1457995a70bd55dd9ca1b7","observation_id":"7fdc8698-1508-428c-81bc-49d4698ad336","resolution":{"observed_at":"2026-08-06T22:41:08.047046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.830151Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"c3c08712-82a6-48b5-9ee2-e884cd307087","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.151171Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a02aab2d9086b1d430ba4619a1819a72847d61029a901f09309e40af565c72c0","observation_id":"a23a837b-7bfe-465a-8445-9b69c65e6321","resolution":{"observed_at":"2026-08-06T22:41:15.895029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.251757Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.251757Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:d093a1187e57be90b7bbd733ae232d5c820f54740a8afbef1cd157da5e6c2063","observation_id":"c1095ca1-58ba-4ecf-b3c5-920ab8acce7a","resolution":{"observed_at":"2026-08-06T22:41:08.251757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08218","last_updated":"2018-05-09T17:26:40Z","snapshot_observed_at":"2026-07-06T06:24:51.822169Z","submitted_at":"2018-02-22T18:16:53Z","title":"VizWiz Grand Challenge: Answering Visual Questions from Blind People","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08218","snapshot_observed_at":"2026-08-06T22:41:08.363669Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.363669Z"},"links":{"cited_paper":"/paper/1802.08218","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:0940ae829dccd8520cfd1827804918536cdc7bba54f91b6838c97f8283fed46f","observation_id":"4a4c75c9-2cc5-478f-98a8-8d6243394041","resolution":{"observed_at":"2026-08-06T22:41:08.363669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:41:08.456014Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.456014Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:d1139f7cabccc703a19ee07caaea387cfeaec1c2c29511e571cfc95a211ed3ba","observation_id":"caf43fd7-4a25-488e-aff0-47b4d871774b","resolution":{"observed_at":"2026-08-06T22:41:08.456014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.610573Z","title":"TED-LIUM 3: Twice as Much Data and Corpus Repartition for Experiments on Speaker Adaptation, page 198–208","venue":null,"work_id":"b9cc3fe5-84bb-42ea-a98f-90f9fa43cb10","year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.535756Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e4e37eb4409a926274cf4d268656eec4d30595b25177f63a98e8f9e70d3c239c","observation_id":"24130295-32dc-4437-8bd4-1a9d53dd9372","resolution":{"observed_at":"2026-08-06T22:41:15.690697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.604727Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.604727Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:10b96f8af74d7c5290f466c07db3518d03646e94c31ec522af10b0f17686aa03","observation_id":"a45e1a72-0485-486f-a6ef-fbca14729fec","resolution":{"observed_at":"2026-08-06T22:41:08.604727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-06T22:41:08.706606Z","title":"Worldsense: Evaluat- ing real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.706606Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:11c8eab1aa86ff41163a22f837c7bd0753688e979a8b053245e91e4667b8b6f1","observation_id":"86971764-831a-49ba-b2e2-67cb9fdfa03c","resolution":{"observed_at":"2026-08-06T22:41:08.706606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.818096Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.818096Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a6f2389d887f925c69d17184236eba0ef0cd718de081625d892e98ffa1ca4f12","observation_id":"1067f61e-484e-4a6e-acb5-5e50ea6be5fc","resolution":{"observed_at":"2026-08-06T22:41:08.818096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.493656Z","title":null,"venue":null,"work_id":"3066da81-109b-4c34-b27d-e1eecd791be9","year":2014},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.896095Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4f6d32075f9fb956be6a5e6b63adff9de9b564b1959ee1fc4e74106851f8de68","observation_id":"91af4e98-0bde-44e4-9fb7-3cec99c1f56d","resolution":{"observed_at":"2026-08-06T22:41:15.536276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.343882Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"a16175c6-cbc7-46b8-bb06-1f576fd42354","year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.002699Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4897d817076c5297c1b41af9277d868058c4b0b0499de510d807ca45eb4ea212","observation_id":"7a62604c-a5a0-4205-8515-e12c0ed20d7c","resolution":{"observed_at":"2026-08-06T22:41:15.399615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.124008Z","title":"Baichuan-omni-1.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.124008Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e634db6d8f7f30eb7e6b83f98e3caacb23eea3e6b35e8c58913c7e4ebe3b1e5c","observation_id":"36e74076-1271-4dd2-98aa-4daa1a72c325","resolution":{"observed_at":"2026-08-06T22:41:09.124008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.186079Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"3b7b4f30-b165-4a6f-8232-db0adf2068d6","year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.236197Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:740a25efb405f654cbc32a052abca682bcbef207d1610c0f80b73d94a31a769c","observation_id":"3b5ba30b-c55a-4e90-8ea9-5408d8b54426","resolution":{"observed_at":"2026-08-06T22:41:15.251245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.320715Z","title":"Omnibench: Towards the future of universal omni-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.320715Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:817809cb979e1fb38e1dafd68f99cc900c217b756f4617b9ba76689756cd69a4","observation_id":"cdc5fcfe-06de-4bef-99d7-b1027923e643","resolution":{"observed_at":"2026-08-06T22:41:09.320715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.397134Z","title":"Omnibench: Towards the future of universal omni-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.397134Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:fb226c024760ce3599355d259e3edf22f56aae25945746d14ee45ef77dab8ca4","observation_id":"de84453d-89d0-429f-be37-bec0b7aab529","resolution":{"observed_at":"2026-08-06T22:41:09.397134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-06T22:41:09.479989Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.479989Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f0e54f1ca64f420eb59c99a8f06828e9603d96e0e3049ff6b582b3a0f26c8240","observation_id":"06bc4f0d-0227-4fc5-9358-d442d0b8ea74","resolution":{"observed_at":"2026-08-06T22:41:09.479989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.031450Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering, 2022","venue":null,"work_id":"830bd8e9-21c0-4541-8724-0bbfec194928","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.570093Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:234688cd7df60a3903ca37563c0b687da7112004fd1c520dec5cc6464d1741b4","observation_id":"885f63c8-9367-4978-9fb4-894fe5dcf70f","resolution":{"observed_at":"2026-08-06T22:41:15.107148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T22:41:09.665514Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.665514Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:05e27e77ecf0b468628cd8dc74a9a3b02bf27e9db7f8535498b9db4c21e8524f","observation_id":"e6be41f8-518f-4f04-ab54-ebb24811f76f","resolution":{"observed_at":"2026-08-06T22:41:09.665514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T22:41:09.774966Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? arXiv preprint arXiv:2307.06281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.774966Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4390ba5648b6124508d4fadb3bd81224f567926a4a00575a62819b55fd086640","observation_id":"bb6f2337-76e9-4cfa-a6fc-2fc12be03d4a","resolution":{"observed_at":"2026-08-06T22:41:09.774966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T22:41:09.864310Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.864310Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:0a63bc470ee17569d61c73de2260787ff08b1b15a172c16a16b83982840b73fb","observation_id":"c640d218-a471-4267-a56e-a0243a26a596","resolution":{"observed_at":"2026-08-06T22:41:09.864310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.867990Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"dab73067-48ce-45cf-b920-a4b2589eae0f","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.951816Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1b4b57d52da48637b693276ff7ccd78131bde4f0b838a978d386740ab7bd2dce","observation_id":"8b404fbb-252f-44f4-b006-15416d8bec1b","resolution":{"observed_at":"2026-08-06T22:41:14.948481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.685138Z","title":"Spoken question answering and speech continuation using spectrogram-powered LLM","venue":null,"work_id":"9f87d5d9-5fd7-4209-be08-84935e26ce29","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.082574Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e71b38623ad0e35866a04e5e6f6a671c338bdab27cf5c5efcbdc0fcd56a594aa","observation_id":"57c96686-2be7-4790-88ff-73314df941a9","resolution":{"observed_at":"2026-08-06T22:41:14.746493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-02T05:48:34.226234Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-06T22:41:10.216134Z","title":"V oxceleb: a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.216134Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f59610116be11403fc134f405f73cb764be6947e7f0b11abe9dbec300f7b0a65","observation_id":"633ee0bf-d760-4d6b-be59-1f7fdf72682b","resolution":{"observed_at":"2026-08-06T22:41:10.216134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.494288Z","title":"Minicpm-o 2.6: A gpt-4o-level mllm for vision, speech, and multi- modal live streaming on your phone","venue":null,"work_id":"56aad69b-fb96-4d00-8408-08138d7ed383","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.316996Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ebfc68f82178fddc330de06b4720c63dd0ca28ec7ba35352fe0d81e998728df0","observation_id":"70251e21-663e-4876-8a5a-e6596219200f","resolution":{"observed_at":"2026-08-06T22:41:14.604431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.336731Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":"9918059b-c1ad-40e8-81d5-588effaa5781","year":2015},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.447338Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:86527868d9ccfd3a2223a969def6c447e3003e88e2872dc13773e333cd698bea","observation_id":"01e21f72-be9b-4566-8e57-04744ff39443","resolution":{"observed_at":"2026-08-06T22:41:14.410005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.195276Z","title":"Plummer, Liwei Wang, Christopher M","venue":null,"work_id":"b8eb9116-492a-4071-bdf5-2daa1a3b40f8","year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.542832Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a2f386002ff0563fe1bcfe2cf2b71a61e5e22032397db2b03b89e77af91e6fab","observation_id":"88e76809-59f1-413b-accd-badad0c908f7","resolution":{"observed_at":"2026-08-06T22:41:14.264172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.049711Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversation","venue":null,"work_id":"3badf041-f8c9-4257-acf7-495e6eab63fb","year":2019},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.673146Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:b2ccfd663788b92f309951e62a57778fb421b3691a56ac8fa99b86f100057975","observation_id":"f400eb72-c47b-4d0c-a95c-99896722aad0","resolution":{"observed_at":"2026-08-06T22:41:14.121328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04388","last_updated":"2025-05-16T08:24:31Z","snapshot_observed_at":"2026-07-06T19:11:36.358087Z","submitted_at":"2024-09-06T16:27:52Z","title":"Question-Answering Dense Video Events","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04388","snapshot_observed_at":"2026-08-06T22:41:10.769779Z","title":"Question-answering dense video events","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.769779Z"},"links":{"cited_paper":"/paper/2409.04388","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:62aafc92b2e06c96f61f7af0c26c79b4acde730a800b41333d5e7715cc4f6648","observation_id":"572dbd7c-2733-4873-b333-0f651e326e04","resolution":{"observed_at":"2026-08-06T22:41:10.769779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:10.938665Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.938665Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:40587af2ea8c83d12991d78612cf4645796e1fb160c9f595109049a0596b9fd0","observation_id":"59b980dd-af92-4650-873a-384245114850","resolution":{"observed_at":"2026-08-06T22:41:10.938665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-06T22:41:11.063492Z","title":"Towards VQA Models That Can Read.arXiv preprint arXiv:1904.08920, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.063492Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:3c76d027dc390ff3a7fc7a7d4d102e68a2d65e7f482d100ad19080e730eccde8","observation_id":"48d88fd4-04d5-4c15-8189-57fc55a9ba9d","resolution":{"observed_at":"2026-08-06T22:41:11.063492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14283","last_updated":"2025-05-20T12:32:47Z","snapshot_observed_at":"2026-07-06T21:27:04.310764Z","submitted_at":"2025-05-20T12:32:47Z","title":"A precise detection method for transient micro short-circuit faults of lithium-ion batteries through signal processing","version":1},"cited_work":{"arxiv_id":"2505.14283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14283","snapshot_observed_at":"2026-08-06T22:41:12.864756Z","title":"A precise detection method for transient micro short-circuit faults of lithium-ion batteries through signal processing","venue":"eess.SP","work_id":"fa8ed028-202f-4ef7-894e-e2cde346c42d","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.176834Z"},"links":{"cited_paper":"/paper/2505.14283","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c3f05a56be97dc8793b655b7af99a9ef8a124c658a213b0c23310a9ef9b88e6b","observation_id":"b9b2e1ea-2cde-4190-aaaa-c0fc00120c60","resolution":{"observed_at":"2026-08-06T22:41:12.954686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:41:11.279409Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.279409Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:289203144a0af0aa26520a0f8318aee8b169660409f2132abc16280958ad8653","observation_id":"a9893c17-2fa5-4e67-ae51-9b576e6ccc2c","resolution":{"observed_at":"2026-08-06T22:41:11.279409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:41:11.369391Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.369391Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f5c7c92c64d0197e54dbfd019f37d5c6884f65cfaa975d2a574806e050c03a91","observation_id":"7f235de8-3e1a-48f2-994d-218f17a1f298","resolution":{"observed_at":"2026-08-06T22:41:11.369391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:41:11.475765Z","title":"Qwen2.5: Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.475765Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6e2f25656e106fa3a31e5438605f622aaecc313debbae17c8a08c90c40e82b5c","observation_id":"b785eea0-6ead-4bd2-9624-86372ae71d2a","resolution":{"observed_at":"2026-08-06T22:41:11.475765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T22:41:11.561442Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.561442Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:d9baaff57466fd31c86f5bed7b5a608d336481eea2a95ee463f2bc3eb77b4581","observation_id":"c07cb19b-8a30-4d36-a3b7-d64e99640254","resolution":{"observed_at":"2026-08-06T22:41:11.561442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T22:41:11.644932Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.644932Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:dfa8d4662f991f958c6f16f72b0a30ff8e458178d9e685c1d33b111b4772a186","observation_id":"90f6c13b-1feb-4c9b-9e49-f33c3b804798","resolution":{"observed_at":"2026-08-06T22:41:11.644932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04362","last_updated":"2023-06-07T11:52:36Z","snapshot_observed_at":"2026-07-06T15:39:41.431581Z","submitted_at":"2023-06-07T11:52:36Z","title":"Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04362","snapshot_observed_at":"2026-08-06T22:41:11.661900Z","title":"Youku-mplug: A 10 million large-scale chinese video-language dataset for pre-training and benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.661900Z"},"links":{"cited_paper":"/paper/2306.04362","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4af90d8512dac58c05e409797e012c0ea2d9ec4d91b68745dc91fc273d366c86","observation_id":"50918665-cf97-4c2f-9f92-a8529f81cb66","resolution":{"observed_at":"2026-08-06T22:41:11.661900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T22:41:11.841114Z","title":"Qwen2.5-Omni Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.841114Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:93562972ef7a2b9bf85487181d65d909936846a4b5e81da3dfca4bd37d8935ac","observation_id":"40f2cc99-5c71-49af-843d-2f38b6f1c043","resolution":{"observed_at":"2026-08-06T22:41:11.841114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:11.967533Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.967533Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:b7404b0d3ea7084e752e3a1dbc09333e80617fe06a09ae5f4e1a19de78c1e78f","observation_id":"01de9829-d349-4f13-972c-fb4f35bb5ecf","resolution":{"observed_at":"2026-08-06T22:41:11.967533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:12.118730Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions.TACL, 2:67–78, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.118730Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c3bd2eb0be2186edcaea1f3fb7be6bdcf9c0de1aa1c15d2e8d6fad794a934073","observation_id":"2b3e6c2e-49c4-4f9b-8419-3f622fc5d2e1","resolution":{"observed_at":"2026-08-06T22:41:12.118730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.880467Z","title":"Berg, and Yuandong Tian","venue":null,"work_id":"2f2611dd-128a-43cf-92ee-8fc66e050c5c","year":2016},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.231890Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:85db23bc774f0dd9aa6208591cf91c3e4e7d5b0e8fdb882446fba7196de9ac74","observation_id":"d0bd4c52-9490-47df-89e2-74c141147d0c","resolution":{"observed_at":"2026-08-06T22:41:13.941233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-06T22:41:12.314340Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.314340Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:dba579be1efe07091046a185cfcf81f681226b6789986f76d53e256369c5ef1e","observation_id":"6222991a-cc70-4303-8a1e-e0bbd2d9d79c","resolution":{"observed_at":"2026-08-06T22:41:12.314340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:12.402858Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.402858Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:37c8cefafee330005c60b1bebc289aa5aeadc7a8e599d10e9246669b23582666","observation_id":"f47c004c-2c97-4e69-bf3a-a2ee632fd0f3","resolution":{"observed_at":"2026-08-06T22:41:12.402858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.735070Z","title":"Zhang and M","venue":null,"work_id":"8107757b-515a-4de2-9bb5-22722b404cb9","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.455460Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:fb1e664ec1c8f39c2d1c3ca048df181d33a3de6a56a4419911fb9a4f987181f0","observation_id":"21460dda-f689-4f1d-940c-7ec25356ea79","resolution":{"observed_at":"2026-08-06T22:41:13.810971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.596858Z","title":"Yin and Yang: Balancing and answering binary visual questions","venue":null,"work_id":"f1983a92-12df-40b7-a43c-ba1ef6d998ff","year":2016},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.567839Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:41d53191ee114810f17b516a40afcd566ea1a7ba3a92dfe805f5d4554455c63f","observation_id":"524268b1-1fcb-4478-a98d-3003119ad138","resolution":{"observed_at":"2026-08-06T22:41:13.679803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:34:40.683764Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2506.20960."}