{"as_of":"2026-08-06T19:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09f48e14d4ac60be70349a76b8046dbc85002122141002e1f77f518a5a2c402d","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:36:53.295540Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07643/citation-record","integrity":"/paper/2606.07643/integrity","json":"/paper/2606.07643/citation-record.json","paper":"/paper/2606.07643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:438ef4b6e24561b6f1cc369c38812ff24259821f28d2eeb1d522224d28feb1b6","observation_id":"7eab8998-10dd-4032-bfff-a4ef379e2b8b","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:84a51ddf1f78eba1beda6de6e46ad06ef406e5b1088bb9ca3948f054e3db9e9d","observation_id":"77902575-2ec8-45be-a020-5b7d0116048f","resolution":{"observed_at":"2026-07-01T23:06:21.430514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:238aac3fb2df1bafd533d19da6eef2875e96d366bf5e5c7c904237c98a03162f","observation_id":"6eca5690-5363-4edb-b11f-58962318387d","resolution":{"observed_at":"2026-07-01T23:06:21.434049Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:0b53f724af4bd2fcfe66886d0c544be3160d5aa085b341a4f215a3ae0deb4762","observation_id":"512b2825-40ee-47e2-8b50-3a8e3177d431","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:874a35cc1f1f8787692ced51efe9a8d5e2e9fe34fa42cc7c484df684c01d144d","observation_id":"6ddadbb4-f963-48a1-88e7-609000220dfe","resolution":{"observed_at":"2026-07-01T23:06:21.420090Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ffa357c891d6d5dda3a3508022cf7a2dffde96f5c4fa27792a84f730cfcc97b5","observation_id":"259a1f8d-3c64-4e9b-ab5d-6a18e128e250","resolution":{"observed_at":"2026-07-01T23:06:21.423543Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:df04f5270896c3154eef2a7bee17a248251c995d5068584cf407af6209e42462","observation_id":"0373cec7-b233-4249-afd1-d8bb5fb0423b","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:0813b5038626a2a2587f12327449c999cf75118fb905fcfb40a627610752618c","observation_id":"5ff05621-1995-4090-a9ae-a8381507d4c7","resolution":{"observed_at":"2026-07-01T23:06:21.427147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:1e52f2c64a5752ba1276179f115780b4038a71c94b4122643e4a25be7eff1bb7","observation_id":"124a9a04-d6ff-41b8-a25c-4938003809d6","resolution":{"observed_at":"2026-07-01T23:06:21.444792Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ab1b7ebf6d9bb17a0a23c10d4dda6a3fa74a5632c662f895bb18c1b3a5bdb5d5","observation_id":"1c9f38ba-f619-4fe0-b813-dcd4f1b0e1ab","resolution":{"observed_at":"2026-07-01T23:06:21.437716Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:76206e8eff543fda927404bb5607b83e902e4b55703d1a115041d8f6b21aed67","observation_id":"03cd71e0-4698-4c2e-a126-47c12f83ff40","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a1baf8cb0160b2282c89d5726c2397ab64da1981fd182a2bc172a33f4b04aafa","observation_id":"d9a7c800-734b-4fd5-9482-44ef9b258c56","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:3d6e4b7159290fc4e86910c0fb8d871d8c3ad997f8f13492aa1037ad6bb5dea4","observation_id":"6b132ff5-61e0-406d-9c0f-cdad268a7692","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a6987478a28b00abc6e61267c8c877ffb2121afa766363e5e3250fee7b66c896","observation_id":"f73eee58-a95f-4b3b-8712-3da237ae403b","resolution":{"observed_at":"2026-07-01T23:06:21.409335Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:9d0a96f99590bbc4f17fed79ea928f0c31d328ffcfbd6c38200db4b026de7479","observation_id":"69f2883e-3ec2-4f81-9b62-78aa3388b00d","resolution":{"observed_at":"2026-07-01T23:06:21.402186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":"arXiv (Cornell University)","work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c91ca8c69899aca38fa64b7c0ae948cffab2e28da6c4effd9c68596b128c8cb9","observation_id":"9fed51af-1648-4b02-b58c-48c1fbe4630b","resolution":{"observed_at":"2026-07-01T23:06:21.406103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":"2305.16355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-07-04T01:19:20.316187Z","title":"PandaGPT: One Model To Instruction-Follow Them All","venue":"cs.CL","work_id":"b3689b4d-65c2-45ae-84da-01b291742486","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:f7fbfcd6a6e3b0c17f7f34be8101cff0d4da146ab2828319445d0075522171bf","observation_id":"f760dea0-d8a1-4938-afc0-fb811b8ab46b","resolution":{"observed_at":"2026-07-01T23:06:21.394725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:366a345524db9127d38b8010ebf1cd240ca9d87b490bf445f4a053850cfe8efd","observation_id":"ca55d9fa-6838-47ad-8f95-b35888bceb2a","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:f8352a5032c658d31e093c7fbf4e2656a007c3e6a9929aa7a66f254dbd10c729","observation_id":"3933720a-cdc7-4355-9816-4cfd579d92fd","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":"2402.12226","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-07-11T00:27:50.594729Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226","venue":"cs.CL","work_id":"647f3087-e96f-4aaa-a599-2dbafb5ac024","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:993aa39e40e44de377c7c2d1ae6da8fa426be4a0a869f600243545899fcf3b99","observation_id":"01482320-8175-4f71-ae28-60370b3353d9","resolution":{"observed_at":"2026-07-01T23:06:21.398632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:e5110665024a5d881e22f182a845c66eeda026b161794b3870c4578d0edad671","observation_id":"ada64e49-89e5-4159-b6be-efc9be3dc9cb","resolution":{"observed_at":"2026-07-01T23:06:21.412807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c99b5dc8f4de71d58f3b0b148cc9cf26fa96d6ab18919b314044118b30c95378","observation_id":"03689645-6d08-4faa-b24a-2f705339135f","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-04T07:32:52.841771Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.18325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-07-04T03:49:30.450433Z","title":"Avhbench: A cross- modal hallucination benchmark for audio-visual large lan- guage models","venue":null,"work_id":"d4409601-3047-443b-878a-0e06b47f611a","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:69bff338f5328c487ab3c75dba9035eefc1e816f37afd6e11df85ae40ff0ee8e","observation_id":"42dd175d-8b13-42fd-a150-27dbe2c49a27","resolution":{"observed_at":"2026-07-01T23:06:21.375774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:8ecadc45025d11fff462507af19d2560b2925bd90f1e54b5023574a0698ee3d0","observation_id":"c8ba0510-7d73-4c6c-9fb1-34ac20f19080","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:3602daef6b0874d9a4ea83f121667ef3699305d17a60f6160c223e331a03193e","observation_id":"3c5484df-8921-4bd1-b9eb-c1a35d82b311","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:2cd3f1bf43691a2271a365be577b98160217f4269ead145e5868fbdfff77d0e0","observation_id":"22da7afc-03dd-4598-a03b-a8c4a95d83f2","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-07-06T20:26:03.338338Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":"2501.15111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-07-04T19:20:06.340081Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding","venue":null,"work_id":"f7355d17-2b25-4606-b51d-e07f909d400f","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:295d2a19539d26b8d47bf1f84f775220a5f85a7af5911cc4f58bf7db9553298e","observation_id":"2b0317bc-baa6-490e-815f-2d0073361aed","resolution":{"observed_at":"2026-07-01T23:06:21.372188Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.08565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.518202Z","title":"Baichuan-omni technical report","venue":null,"work_id":"fda3d528-4c1c-43ea-9da0-fa19c174c861","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:6d174797e595a15071d64e3a9e2160394b408ecc87e110cac5b25e87817146fa","observation_id":"8b9b6cb0-7057-4580-8937-d4b939526d4d","resolution":{"observed_at":"2026-07-01T23:06:21.379582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a9481ee14e30ada305780705d6a0a9bde7f3b72ce21410adef6321fc587facc6","observation_id":"43a93783-f378-4293-8374-2d54b854bef6","resolution":{"observed_at":"2026-07-01T23:06:21.387364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a015764a66e7faede9b15cba6299e449fd9ba30a4fed2b2cef338237af47f301","observation_id":"d71c8850-c65d-4c82-a6fe-d097db8bfe65","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:de0962dc91ac66ce90b051f3d8b7c6d2b58b7fa93b5844d46043091ed886f769","observation_id":"2cff3767-114a-4b3a-81b2-a27fb5e2465c","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12219","last_updated":"2024-10-16T04:29:46Z","snapshot_observed_at":"2026-07-06T19:34:18.918585Z","submitted_at":"2024-10-16T04:29:46Z","title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","version":1},"cited_work":{"arxiv_id":"2410.12219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12219","snapshot_observed_at":"2026-07-01T23:06:21.381526Z","title":"Omnixr: Evaluating omni-modality language models on reasoning across modal- ities","venue":null,"work_id":"ccdbb47d-a108-43e7-98dc-db3769fb9b31","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2410.12219","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:5dd799fa28b5bbd082168fbccd683110cc9a62c0bbb821be43143b895d9acebf","observation_id":"6b7387cf-e11a-4262-87a7-3310372b1b71","resolution":{"observed_at":"2026-07-01T23:06:21.383632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3161.354829","doi":"10.1145/3503161.3548291","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the 30th ACM International Conference on Multimedia","venue":"Proceedings of the 30th ACM International Conference on Multimedia","work_id":"0a0e291a-c11e-4b43-a688-97c34450c946","year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c810508d4e42b6dad365926af1e3fd1a1730e10442615f450d3e17f9f9d272ff","observation_id":"f45cb49a-d6f0-4171-92d7-bd7672cb6225","resolution":{"observed_at":"2026-06-28T14:42:17.912950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:389df772f18fe7aacb69a84634022a8093f3db1990bb502b88898e085c40afcc","observation_id":"3efb50be-37aa-4cdf-bf77-c48eb6fc0e70","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03272","last_updated":"2024-05-06T08:42:34Z","snapshot_observed_at":"2026-07-06T18:10:16.760984Z","submitted_at":"2024-05-06T08:42:34Z","title":"WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning","version":1},"cited_work":{"arxiv_id":"2405.03272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03272","snapshot_observed_at":"2026-07-01T23:06:21.362709Z","title":"Worldqa: Multimodal world knowledge in videos through long-chain reasoning","venue":null,"work_id":"f8ee7a4f-5655-4208-9f4d-537bacc5e1cd","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2405.03272","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:fbcd2e2e91793147638ed8718043c1e9615b9250fb401e119431b7445550ce0c","observation_id":"6f764bd1-c41f-4b79-b7b9-0cde6e78e852","resolution":{"observed_at":"2026-07-01T23:06:21.364975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:398c51952591fe919a963c61f8d4a7c6c9e56c75556e1432b87ea984241ab5f3","observation_id":"73b812e0-94b1-48af-aa80-06f250226bb2","resolution":{"observed_at":"2026-07-01T23:06:21.352180Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Journal of Artificial General Intelligence , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c674324fa35700d1c61637c25ca273ced35054a89fdce3722ee281666978ca45","observation_id":"fbc68ea5-6d45-4c17-b63c-ed485cd01f64","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Nature Communications , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:4292d1fb8187770d7d4bd4fdbb66ffc8c64f7c59f8c4aba01791a4e086a5a50d","observation_id":"1c55f1c5-60de-4a54-8364-479fe1057f1d","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:eca98d730bbe686eae98e8eef9b1c5fa41c7d8e44fcad9f628f4a820c180482a","observation_id":"e5fbfe49-4ac7-4f20-aca4-0629f563089f","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"2007 , publisher=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a0f7f189d89cbe5fd57cd348d7541bedf7ea37300c799c59f1e09df76368eca5","observation_id":"f11e1a63-ec2f-4de3-8af6-49b295106a5a","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c65c097e48fc3c996f777ed04c48229721389805dbf96531499ac9f673eea7b0","observation_id":"f248a72a-a0e0-43d1-8920-a65a8acbbbc7","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:b8445d67947efca959b731680d6d2bd13b4d1a79ec86d97921d6df75bf83ec0e","observation_id":"1684874b-3080-44a1-b9e1-4cefdb1db4c3","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:e3e194df0f306c87cf09f3732027c037a3a330d39a89e17ec62654dfdd4f9423","observation_id":"405639c0-0048-44e9-a116-5cdd7a8613b7","resolution":{"observed_at":"2026-07-01T23:06:21.355934Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:aec3f84649ad01ca62ebe759756488ba42a5e6e65845155ccf5b1bd307dd01a0","observation_id":"b5116ad0-73cf-4d52-80f8-dd8d3cbf9026","resolution":{"observed_at":"2026-07-01T23:06:21.368488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:95a809066789c0950aeb9304a6a0be4e99c4d9932e0923d88387dea5bd49035b","observation_id":"711dfbc5-a0cb-4863-a6cf-f4bc91566c03","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the European conference on computer vision (ECCV) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:9ddc546ef5b1f20eec708f394c8b3de029d9cc7a92e72f66725c19906165942d","observation_id":"8a77d57d-3757-46c9-a35a-d6a7eebef130","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:54224b2ac80045302b43b1af045c63483a2bf9cecaaae54a1592761c36818c4b","observation_id":"358d3fbc-86f2-4537-ba00-a055eff396f1","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:21cccf77ecee00e61f4419fe398963e1581a103d098a1cf206cd07633c9cc8fd","observation_id":"523bea54-7155-469c-9270-28c7a33d5377","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:071e6533de2c59c38ce3299816f762f3939ab31f501658b74161275a1f93fcc4","observation_id":"285e210d-0a59-48f6-983a-e86204f4382d","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Nature reviews neuroscience , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:2420091fa2a62829da7d2d09c3aa8ee2d207fdd955bad431ff46b96562a7ce6d","observation_id":"8ec5c04d-9b69-4ecf-b772-9de5fe61245c","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:06bc65a7ae0786e3853b4a66a6f63861545cad2d875e15fc2a6284a9f63d127d","observation_id":"8421f70d-ce34-4a31-a770-557c3de079e5","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:1a21f2dff178792ba690e80f4a5d697acf98d30546c2a0997685dde4d5c8c664","observation_id":"95cedbdb-05c3-4a06-ac54-ae88dc719f89","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Annual review of vision science , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ee928864a59347a00c98ab7ca2891aa78c2dcf4b2c4ca6d14d6975416e77b665","observation_id":"306d2ccf-2767-4b63-b476-2b7cb3111e3a","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Current Biology , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:dc0de797c172346b3e2e5016cc1bd17660749761fa3733edaa0b4d2e1e6cfb6f","observation_id":"6bc095df-d393-4fff-bd6d-09a67dc7b56d","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Neuropsychopharmacology , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:8451a443ad7798f88dde2b035a9329281d3ab96755f3dccc1053362f58291924","observation_id":"d1430315-2e72-409f-aaf1-7cc05310b29b","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"IEEE Open Journal of Signal Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:32bc129b13854ec408b89789284c8751c996ba92f9783ca75d92d8b15ed7036a","observation_id":"c8b9f8af-727b-4968-881a-cdfe97acfe78","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:5a581a937da71e25bf592c90a231c77061eaa7e7e08a41043fa3078ec359068d","observation_id":"ead9513f-0f4b-4682-8143-5ea973647017","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:32b671eaa3600cca6c2fdc656873f97695c910b44e68d89c836f9d5bd579bc96","observation_id":"65eca983-78dc-43d8-af42-ee4c9ea5a895","resolution":{"observed_at":"2026-07-01T23:06:21.391014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.284405Z","title":"Baichuan-omni-1.5 technical report","venue":null,"work_id":"d2c9e57e-0e5b-4999-b035-ef159319e83d","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:811a0cf5bf9751feb8190607d94eacf17ce99f3631fb8fc6e45b5e2e28ef18a1","observation_id":"8a4f4a3c-7a4c-44aa-ab98-d71ba68d7101","resolution":{"observed_at":"2026-07-01T23:06:21.359908Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-07-06T20:48:31.837669Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-07-04T19:20:06.377429Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","venue":null,"work_id":"bf1e132b-9fd3-4be1-9466-fc699b85e71a","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:5f372a4bf52d8ec50ac442646cccd00314c3e7e733391cfeb701f2492031a3a8","observation_id":"5553b942-08b1-4b22-a187-1ccbe864fa2a","resolution":{"observed_at":"2026-07-01T23:06:21.416414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:f1221adfa73c7aeca18550ed5915531401ec9a6ede87e585bede9c724bfcb854","observation_id":"af222d8e-548a-4726-bb9f-ee3dffeb813a","resolution":{"observed_at":"2026-07-01T23:06:21.441366Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ceba99d5e9f78f2b356d2d33d4e45a7f9d5a207fdac23673f6271859307d7bbb","observation_id":"f137f6d5-c43a-4677-9922-2d3efa2a795b","resolution":{"observed_at":"2026-07-01T23:06:21.347654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04620","last_updated":"2025-05-07T17:59:32Z","snapshot_observed_at":"2026-08-03T14:33:49.497365Z","submitted_at":"2025-05-07T17:59:32Z","title":"On Path to Multimodal Generalist: General-Level and General-Bench","version":1},"cited_work":{"arxiv_id":"2505.04620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04620","snapshot_observed_at":"2026-07-01T23:06:21.338407Z","title":"On path to multimodal generalist: General-level and general-bench","venue":null,"work_id":"f682a094-9433-46ea-9dce-42c7c417fd1c","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2505.04620","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:2648b7d441ef0f750ee02d15a9bf7d919b4f976ff49b01114f506126b3a6743f","observation_id":"43432d11-d636-49d1-ba2b-56cb6e0df3fb","resolution":{"observed_at":"2026-07-01T23:06:21.340815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:b69dbb6da5e059f46c69f9b0244d7daeb9cfbbeb386ebf3e1465f71719465f7e","observation_id":"e4c6475b-f81d-4af8-a2e0-5d8304dea673","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:fac9de7b8865ba96f6ad7e929de6e95cc32d967ca2591a71414df4dbbd295b2f","observation_id":"7c1f08db-ba8b-464e-bc9a-54c54fd8d491","resolution":{"observed_at":"2026-07-01T23:06:21.331415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a0f4b5b88ebe267fa69078fbdd9664829fdf34ddf8c41c01759798c8d9f9f2b2","observation_id":"28df9847-0e7c-41ca-b84d-889692bb0d2e","resolution":{"observed_at":"2026-07-01T23:06:21.336404Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:701dcf120c3499a14f8a2f22490af567b244962c48858114a01b56e78b251174","observation_id":"36603af1-061d-4692-b661-d9cc357fc349","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:f3433a5d74d35719ef5ca7c32804d8c8baaf9464386f3f9009482b2fbba51787","observation_id":"73b3c104-6f09-47f0-87dc-56088d024a10","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"IEEE Access , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:5496a0a8ea6ca31171120d6a3446c1dd331011ab38730e10da6e417f644aa51f","observation_id":"7437bf96-f31c-41bf-a731-7a019c1d5e2e","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:ae97e18a2a28b36e28cffbef047bce7eb9dd811bf391bc1a41edd84f2e04be0b","observation_id":"86ea63b5-35e0-4eeb-a983-593355edac8b","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"International journal of Remote sensing , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:bc59117e027e9558d87cc56969b1025c2a4627a4ce85220ff09435e7d218cae2","observation_id":"130d376f-fb46-4d91-be11-cd66874094dc","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:1a7c19a5f8ed6f14e2d9411bf693e76afaf06fbaf8563858ef0d611ac68b6f59","observation_id":"bb3c1aa5-fba1-47b9-ade8-14da3e146d58","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:c79d1646c03fe27857eb5cd6caed5aa1b7598dbb6a0455949423e36bc7b895fb","observation_id":"6f732fe6-8efe-4257-a26e-1e82583ca98a","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"ACM Transactions on Multimedia Computing, Communications and Applications , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:aa64b8b8860cee5ea05b8dd1af14f0dccc3302af6f4a94d0ec753ab21e62e0ee","observation_id":"d968893a-e41c-4071-98a4-1e07c77b1b77","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:92fdf2178f8322d29a4fd27cc8dd79154e0b04816918e1ec1f62918cc9fbae3b","observation_id":"cc820081-9fd9-4594-9cd2-9174f3a85055","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i6.28378","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , isbn =","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"f94657f3-7fd4-4304-b87e-b42807fc9134","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:951e529c0b41403dc00c9d10385e2a6f7731212ae5d1c0e1fe4a7cf4f99d8287","observation_id":"0f8aee72-c88f-4de0-b55b-5b06dbcc371f","resolution":{"observed_at":"2026-06-28T14:42:17.915455Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:8a981bd4fd4cd8d282f971dfcabb4d7395a73318d8f5984aa8901734e1591bff","observation_id":"49e5515e-8e9d-4fa0-8b03-4f9ab08d8811","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:9bbd136794cc75867d8d0c26f5d63072371c0e02902f3c20abb84a28e26c8d3c","observation_id":"d3b95ef4-a88e-4e68-9463-6be83c61a2a2","resolution":{"observed_at":"2026-07-01T23:06:21.318674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00358","last_updated":"2025-02-20T22:37:12Z","snapshot_observed_at":"2026-07-06T20:29:26.524162Z","submitted_at":"2025-02-01T07:40:29Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?","version":2},"cited_work":{"arxiv_id":"2502.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00358","snapshot_observed_at":"2026-07-01T23:06:21.321184Z","title":"arXiv preprint arXiv:2502.00358 , year=","venue":null,"work_id":"352abb85-4dcc-4824-bbd4-9a00add0b52e","year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2502.00358","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:796f94c1fdd729cef4aeb6e4b35ef0fb24980a72c2bdcae0456a492c046db00d","observation_id":"a7d7f17a-5f35-478f-9cd9-388ff19e134c","resolution":{"observed_at":"2026-07-01T23:06:21.323631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-04T17:39:22.305225Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:54235e426c5dec7b16451b5e270d42e4abdcf75f734154dc89cc35564e0690ce","observation_id":"f129b174-1b38-463b-a386-c40262bf78de","resolution":{"observed_at":"2026-07-01T23:06:21.312897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:6b842caf5245beaeba337a3f2d76daa39f3c751e8bc7cbc5724bbea5b5238ea6","observation_id":"51799bc7-832b-4828-a5f4-fb065bbcfb93","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2502.04326","doi":"10.48550/arxiv.2502.04326","metadata_source":"pith","pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","venue":"cs.CV","work_id":"9fb20f56-0773-406f-93c4-122a3e2ab9e4","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:b20eaebf7b6b7522abced4b6f0fbe9a36e9cfb86672c8ae68eeff24081af7066","observation_id":"95db0db5-b3ce-4464-b784-cd1cbc29a304","resolution":{"observed_at":"2026-07-01T23:06:21.293636Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17862","doi":"10.48550/arxiv.2505.17862","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":"arXiv (Cornell University)","work_id":"8c7aec87-020f-4959-9199-7df8b9231cc4","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:98cc19d8a9b43891cc32231d3dbdeac4fc3085c034eb9df3dbe7ac66e34a400c","observation_id":"477e8220-4d10-41cd-8307-17383bc18592","resolution":{"observed_at":"2026-07-01T23:06:21.299475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.21374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-07-04T16:39:58.338552Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","venue":"cs.CV","work_id":"6d26f54b-33e5-4b18-86b0-7202ab41b867","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:82d6a85b5a78783cb0c386e346fd75b5271fa9e47a439f8f4f382be5ad1729e3","observation_id":"c7fc47f5-d11c-4520-8194-9a3234e73e52","resolution":{"observed_at":"2026-07-01T23:06:21.306035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:36:53.295540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:61a7ab5fa4f2a0a1177f1ae21dd89ecb045d03d0a3b1d6bcc0030991a7d517a7","observation_id":"c8fbf330-f926-438c-89ce-90c093d3762d","resolution":{"observed_at":"2026-06-28T14:36:53.295540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":32,"parse_uncertain":0,"unresolved":47,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2606.07643."}