{"as_of":"2026-08-15T10:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94c128139981ac539d8ddb632cf6ffb6ffaca9639ab1a78b75190baa7dfd3eb9","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:38:00.408861Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:21.605201Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T13:08:08.703056Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"cited_work":{"arxiv_id":"2604.23321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.23321","snapshot_observed_at":"2026-07-03T13:08:08.703056Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","venue":"cs.IR","work_id":"a812bd44-bd81-4a6e-a59e-cb3f9e30ccf9","year":2026},"citing_paper":{"arxiv_id":"2606.11700","last_updated":"2026-06-10T06:23:46Z","snapshot_observed_at":"2026-08-08T19:46:04.122204Z","submitted_at":"2026-06-10T06:23:46Z","title":"CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T08:28:14.637197Z"},"links":{"cited_paper":"/paper/2604.23321","citing_paper":"/paper/2606.11700"},"observation_digest":"sha256:48d8f4c928d9b4696c2dcc1196bfa1ffc84d6bb34f3f0fe8211d552cef760933","observation_id":"8a761262-7854-419e-b4e3-46198bf851f4","resolution":{"observed_at":"2026-07-03T13:08:08.705595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23321","snapshot_observed_at":"2026-08-05T11:43:21.605201Z","title":"2604.23321 , primaryclass =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03826","last_updated":"2026-08-04T15:36:17Z","snapshot_observed_at":"2026-08-09T17:07:39.724064Z","submitted_at":"2026-08-04T15:36:17Z","title":"Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:43:21.605201Z"},"links":{"cited_paper":"/paper/2604.23321","citing_paper":"/paper/2608.03826"},"observation_digest":"sha256:72271e7eff08271b62211374797dfbf028a944fddbde36fc7561ad9d139fbb83","observation_id":"f56c67d7-d7e8-412b-aefc-7ba796178cab","resolution":{"observed_at":"2026-08-05T11:43:21.605201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.23321/citation-record","integrity":"/paper/2604.23321/integrity","json":"/paper/2604.23321/citation-record.json","paper":"/paper/2604.23321"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13668","last_updated":"2025-02-19T12:24:46Z","snapshot_observed_at":"2026-08-07T18:05:28.927119Z","submitted_at":"2025-02-19T12:24:46Z","title":"PeerQA: A Scientific Question Answering Dataset from Peer Reviews","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13668","snapshot_observed_at":"2026-08-02T15:37:59.601400Z","title":"Peerqa: A scientific question answering dataset from peer reviews, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T15:37:59.601400Z"},"links":{"cited_paper":"/paper/2502.13668","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:b7f779920eb4a2161f26756eeb44fbbbc2706d652a5132c112dc8fa96cda4a66","observation_id":"e02b702a-b898-4081-8952-d92c921d1c2c","resolution":{"observed_at":"2026-08-02T15:37:59.601400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:37:59.667837Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T15:37:59.667837Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:fd843d15572fb3cd131098b1597654ee717f951d81d92c1c3159d3020a1f3f4c","observation_id":"5ee6f910-eab1-43f8-b805-f8b1247f76b8","resolution":{"observed_at":"2026-08-02T15:37:59.667837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:37:59.804490Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T15:37:59.804490Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:bd2390d7c495dc372fc216c72919a2c53151c103bba6c84f1aa4dad0b2e67207","observation_id":"be97176b-8999-4c0a-a844-fa4983f5c2e1","resolution":{"observed_at":"2026-08-02T15:37:59.804490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:37:59.972570Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T15:37:59.972570Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:56bbcef7f94b48a977d57e59dc713945112a40fdff80dda550fd46576867c6d4","observation_id":"5a01987c-b7af-4985-85d8-36dc2de9fffb","resolution":{"observed_at":"2026-08-02T15:37:59.972570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.080293Z","title":"Finevideo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.080293Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:9d75b2a0a8d8e2a318b6c39685977f78386a244286c89e0ebc3b9ed1fea55188","observation_id":"2c7d8de9-115b-4ac2-bcb8-24e954380f03","resolution":{"observed_at":"2026-08-02T15:38:00.080293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08435","last_updated":"2020-11-23T16:16:35Z","snapshot_observed_at":"2026-08-14T20:45:09.754724Z","submitted_at":"2017-07-26T13:40:21Z","title":"SPEECH-COCO: 600k Visually Grounded Spoken Captions Aligned to MSCOCO Data Set","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08435","snapshot_observed_at":"2026-08-02T15:38:00.186498Z","title":"Speech-coco: 600k visually grounded spoken captions aligned to mscoco data set","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.186498Z"},"links":{"cited_paper":"/paper/1707.08435","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:d61fe8dccdbb3cfcaf16277d756ae61850fac373c134691cabb380e238fb0671","observation_id":"567df291-9769-4a3b-9e87-6e39f217372c","resolution":{"observed_at":"2026-08-02T15:38:00.186498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.216508Z","title":"Omniret: Efficient and high-fidelity omni modality retrieval, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.216508Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:1a799ff54040d9dc572e60ff13c3adb7c42b135db1983e6cdfc788ee95eaaf18","observation_id":"7d38c8be-f610-428c-bb6a-caada6e2a3fe","resolution":{"observed_at":"2026-08-02T15:38:00.216508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.221185Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.221185Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:6f458b670a593b8832dc8386060c166ed7a4a2fea085796d10d68c3f9f8c85b9","observation_id":"88c07958-e6a2-462e-b220-5fb7fbe8ae45","resolution":{"observed_at":"2026-08-02T15:38:00.221185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-02T15:38:00.232600Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.232600Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:a1728dea721de98d90147c514685901549983919f72c682fe809a6c6cd9e0c8a","observation_id":"4dce2d9f-e9a3-4a27-a9b4-baf509a641f9","resolution":{"observed_at":"2026-08-02T15:38:00.232600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.240182Z","title":"Sophia Koepke, Andreea-Maria Oncescu, João F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.240182Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:9a56926a4c8cc9a44deed0078544cbf57b63c142a166becea6b1fffab83b489f","observation_id":"035bed14-8822-48bd-a885-6511ad96c66d","resolution":{"observed_at":"2026-08-02T15:38:00.240182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13270","last_updated":"2025-02-18T20:29:01Z","snapshot_observed_at":"2026-08-07T18:07:13.569384Z","submitted_at":"2025-02-18T20:29:01Z","title":"REALTALK: A 21-Day Real-World Dataset for Long-Term Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13270","snapshot_observed_at":"2026-08-02T15:38:00.244597Z","title":"Realtalk: A 21-day real-world dataset for long-term conversation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.244597Z"},"links":{"cited_paper":"/paper/2502.13270","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:3b58610442f3de5df9aff786dabd95f0ffd7be844554c03fe8130269c84c4569","observation_id":"67175c60-b490-4eb0-8278-5b2a3856a764","resolution":{"observed_at":"2026-08-02T15:38:00.244597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09609","last_updated":"2021-11-29T18:35:51Z","snapshot_observed_at":"2026-08-13T18:42:56.775902Z","submitted_at":"2021-07-20T16:42:58Z","title":"QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09609","snapshot_observed_at":"2026-08-02T15:38:00.249144Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.249144Z"},"links":{"cited_paper":"/paper/2107.09609","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:b2f3f2041e204268b7ebc1944ae6c0619ef2f5f3c5b04398c48b5c472457deab","observation_id":"a9735ae1-a460-4008-b20c-7a75cc8a287e","resolution":{"observed_at":"2026-08-02T15:38:00.249144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14558","last_updated":"2026-04-03T16:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T16:15:30Z","title":"R2MED: A Benchmark for Reasoning-Driven Medical Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14558","snapshot_observed_at":"2026-08-02T15:38:00.253808Z","title":"R2med: A benchmark for reasoning-driven medical retrieval, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.253808Z"},"links":{"cited_paper":"/paper/2505.14558","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:e80257c177b9aa9b9b702d59a14aaf2fef65ca6f1949dbeaa733811cb509b1fb","observation_id":"5014bc2a-f5d9-459a-8106-4024e52514c0","resolution":{"observed_at":"2026-08-02T15:38:00.253808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-08-14T12:22:57.900954Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-02T15:38:00.258413Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.258413Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:59e31833465ecffdf2985bbeeaf856571be8fb3fdecb9af7b004f92c5bf388b0","observation_id":"8f307f57-2ddc-4367-bdfb-511119464ef7","resolution":{"observed_at":"2026-08-02T15:38:00.258413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-12T22:07:52.454279Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-02T15:38:00.262447Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.262447Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:2acb8c6489c744229dcdcbcd1660dffafb8aa78c8de7324db6135be8d8615593","observation_id":"d30ecb05-8785-4015-a30b-1b2b6393d385","resolution":{"observed_at":"2026-08-02T15:38:00.262447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-02T15:38:00.267326Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.267326Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:e2980a515d3aed3fedf7642b07e3f428badac9949ea8d15fef3e6c5276ef2ab8","observation_id":"f8adaf1d-1718-4987-a065-31a019237d68","resolution":{"observed_at":"2026-08-02T15:38:00.267326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.271648Z","title":"M ulti C on IR : Towards multi-condition information retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.271648Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:b73d99bf6128ab46a0a4f4481986a9807694b87898762f1cdb24781fc5c65268","observation_id":"f7a3bb33-fcb2-4121-acc5-9fa0b2785631","resolution":{"observed_at":"2026-08-02T15:38:00.271648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.275761Z","title":"Tools are under-documented: Simple document expansion boosts tool retrieval","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.275761Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:177d9d8d36051cb7e1b8dabc1d4532e1317f7a56ae061c54dc382fbbc6f55b6b","observation_id":"28e923bb-262d-4c16-a02c-98b0422e43e6","resolution":{"observed_at":"2026-08-02T15:38:00.275761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.279937Z","title":"Rethinking reasoning in document ranking: Why chain-of-thought falls short","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.279937Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:b806da3045fd91f013fa6b4dae2c54a8a703eeb803fcbb8c3e40c864e400729b","observation_id":"0ff0073b-c7b4-4c3a-955f-8a4799f8490a","resolution":{"observed_at":"2026-08-02T15:38:00.279937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.284151Z","title":"Beyond global similarity: Towards fine-grained, multi-condition multimodal retrieval, 2026 c","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.284151Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:6f63b1bb8adcedaf9266def6ce358f3535950c20efa5af37be55b6fbb71c9bd5","observation_id":"67e29c44-eacc-4732-8ca3-6005752eb411","resolution":{"observed_at":"2026-08-02T15:38:00.284151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.293086Z","title":"Vidore benchmark v2: Raising the bar for visual retrieval, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.293086Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:2894d634b1999050be27b09e3ec51fbee469343a3ff627eca1b3fc7e4ec553d4","observation_id":"6272ba0f-a9fa-4ace-b6d9-f7b5cf48e8cd","resolution":{"observed_at":"2026-08-02T15:38:00.293086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-08T15:48:31.665148Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-02T15:38:00.297302Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.297302Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:f8347e1cfc2a0950cf9499cf280ae6971988e6c40db9f8014386a45081a48b7a","observation_id":"184c72b8-3913-44a7-ab61-9ec3da40697f","resolution":{"observed_at":"2026-08-02T15:38:00.297302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.302040Z","title":"Tut database for acoustic scene classification and sound event detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.302040Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:704e01268d42d95bdda018845662b2efcc2401cee5d4467e6af83c86a5704f79","observation_id":"01e57d65-5c97-4053-922b-5dd1d66e6266","resolution":{"observed_at":"2026-08-02T15:38:00.302040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-08-14T05:00:07.792972Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-02T15:38:00.306722Z","title":"Mteb: Massive text embedding benchmark, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.306722Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:b0563b61afd7bcd0d9ef7cabf3788b74e0f6d66aae74d06ea1935ca442ef9eb1","observation_id":"028ba7fe-b448-4655-b5e7-d6060ebd2eae","resolution":{"observed_at":"2026-08-02T15:38:00.306722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.311152Z","title":"Esc: Dataset for environmental sound classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.311152Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:6e521d4f353096f2be3195d8fdf5f8cd7ad3a1eaaf78b3f776d74a840e87e2df","observation_id":"39293f5e-88a8-4c26-bf5d-490f9f208b6f","resolution":{"observed_at":"2026-08-02T15:38:00.311152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.315093Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.315093Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:0d2ba12f9b5deb630322209facb521b8cd85e433e8f931be632ede7e62d859d3","observation_id":"202cfc34-a5a6-4797-831f-5ca4484e8045","resolution":{"observed_at":"2026-08-02T15:38:00.315093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-02T15:38:00.320072Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.320072Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:2e96c95d12700f3d62b9dc1041081f230d399eb947398b7e0d9391dbdb830793","observation_id":"20d2c1cc-7012-4b0c-b2fd-6d0f6a92d898","resolution":{"observed_at":"2026-08-02T15:38:00.320072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.324739Z","title":"A dataset and taxonomy for urban sound research","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.324739Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:87985c1e4edb8632eb6cfc3cbf90c0622f06c86386b5485de334a1a3583f9874","observation_id":"3a4cc936-d497-4b17-90c6-f22841fed508","resolution":{"observed_at":"2026-08-02T15:38:00.324739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.328699Z","title":"BRIGHT : A realistic and challenging benchmark for reasoning-intensive retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.328699Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:f95a8232e19b72119ed812aaf724de306201664f402b3ac3a7042ce7aa35fe41","observation_id":"43faea2c-487f-4e3a-aa09-2d2cd1a698ec","resolution":{"observed_at":"2026-08-02T15:38:00.328699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.333316Z","title":"Wave: Learning unified & versatile audio-visual embeddings with multimodal llm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.333316Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:ceba983249df549bfece29a898f98fb25062500a81282a1b8713bde2a68b87e8","observation_id":"dea70d04-a3ea-4622-9e84-82c5112ba115","resolution":{"observed_at":"2026-08-02T15:38:00.333316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08663","last_updated":"2021-10-21T01:18:28Z","snapshot_observed_at":"2026-08-09T23:22:21.200279Z","submitted_at":"2021-04-17T23:29:55Z","title":"BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08663","snapshot_observed_at":"2026-08-02T15:38:00.337307Z","title":"Beir: A heterogenous benchmark for zero-shot evaluation of information retrieval models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.337307Z"},"links":{"cited_paper":"/paper/2104.08663","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:8b2b197c141fbf6b35e272a1e5fa12393553f964e3ada2791e3001ce9779b4f9","observation_id":"d951e97b-9864-476e-a8c4-630e725a7077","resolution":{"observed_at":"2026-08-02T15:38:00.337307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08842","last_updated":"2018-03-23T15:34:03Z","snapshot_observed_at":"2026-08-14T19:33:07.734744Z","submitted_at":"2018-03-23T15:34:03Z","title":"Audio-Visual Event Localization in Unconstrained Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08842","snapshot_observed_at":"2026-08-02T15:38:00.345758Z","title":"Audio-visual event localization in unconstrained videos, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.345758Z"},"links":{"cited_paper":"/paper/1803.08842","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:ca5e27939039d869ce24fc133ecbc02c4b35506d51f4cba630ceab7668eafdc0","observation_id":"c5f4bc92-9a9f-499f-b50c-e30dd4651448","resolution":{"observed_at":"2026-08-02T15:38:00.345758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-08-14T19:27:43.149965Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-02T15:38:00.350293Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.350293Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:fe4b3abf67fcf9ecc4c6c2eff47e40345840704a6972c8397b82661c8d4ba639","observation_id":"9b9f247d-fe91-4b4a-ba01-daca43612339","resolution":{"observed_at":"2026-08-02T15:38:00.350293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-08-14T07:11:19.240177Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-02T15:38:00.354435Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.354435Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:0cd0c3b54d14d6ec02bc9426871dedd31b77c6da82a8b46afff9b8e136c4fdd3","observation_id":"c2568888-543b-4bd7-84e6-0b4341796ece","resolution":{"observed_at":"2026-08-02T15:38:00.354435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.358529Z","title":"Followir: Evaluating and teaching information retrieval models to follow instructions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.358529Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:05aedaecd7b009e8261d169fa5eb0f51a05badbab0bb3883ac9eacc4bb0f176f","observation_id":"5391b229-b3a2-490f-a66a-8c0073909e17","resolution":{"observed_at":"2026-08-02T15:38:00.358529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04745","last_updated":"2026-04-19T12:11:06Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T09:11:33Z","title":"KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04745","snapshot_observed_at":"2026-08-02T15:38:00.362244Z","title":"Knowme-bench: Benchmarking person understanding for lifelong digital companions, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.362244Z"},"links":{"cited_paper":"/paper/2601.04745","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:48c67e014be1cede615e531299159c68007bb78cfb4ed1caf1758590a467059c","observation_id":"36e29bc2-19e1-4721-ae95-4bfb2024f01b","resolution":{"observed_at":"2026-08-02T15:38:00.362244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.366089Z","title":"Omni-embed-nemotron: A unified multimodal retrieval model for text, image, audio, and video, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.366089Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:bd4561f1610f3a67f541d92dcc624b78a8050fc4c85117a715595dfcaed57973","observation_id":"464c09f7-1feb-4ce5-afee-c9f0d26788fa","resolution":{"observed_at":"2026-08-02T15:38:00.366089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-08-14T14:35:02.110612Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-02T15:38:00.370131Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.370131Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:94905db7bffc46d7caa10bd5f69de36b0a21141f588550d42a4ce346056ec3a2","observation_id":"2b672c38-bce8-4dd8-9242-2a6211c585da","resolution":{"observed_at":"2026-08-02T15:38:00.370131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.374424Z","title":"Universal retrieval for multimodal trajectory modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.374424Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:ab729b46498d1430a10130b284a50ea20d14c3c4d214def76f6951ae4dc15278","observation_id":"c7ea29bb-2682-4a44-91af-89cce3ac53e8","resolution":{"observed_at":"2026-08-02T15:38:00.374424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.378633Z","title":"Deepplanning: Benchmarking long-horizon agentic planning with verifiable constraints, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.378633Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:c6609c0dd7259d56b7f829c824f40be345219c08063d20f4819c80d4be41387a","observation_id":"3cfab254-6dca-4b8c-85c5-cd7196019487","resolution":{"observed_at":"2026-08-02T15:38:00.378633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12572","last_updated":"2026-08-03T10:01:54Z","snapshot_observed_at":"2026-08-06T23:30:49.080134Z","submitted_at":"2026-03-13T02:09:57Z","title":"LMEB: Long-horizon Memory Embedding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.12572","snapshot_observed_at":"2026-08-02T15:38:00.382531Z","title":"Lmeb: Long-horizon memory embedding benchmark, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.382531Z"},"links":{"cited_paper":"/paper/2603.12572","citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:bd87d4feb66f36c1a52865cd9f6c7cd35df3a995fbad792b458f54ede4dc854b","observation_id":"3fc5ca10-0107-49ff-b286-cfa9ff315ec6","resolution":{"observed_at":"2026-08-02T15:38:00.382531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.386782Z","title":"Beyond content relevance: Evaluating instruction following in retrieval models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.386782Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:4210057e7d2752835da6998ff501405ae8a80bce47eee0543e366cf0d376ca4a","observation_id":"1e3d54b0-ccb2-4b41-a7d4-705b55731d85","resolution":{"observed_at":"2026-08-02T15:38:00.386782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.391174Z","title":"Longembed: Extending embedding models for long context retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.391174Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:525f4a336d2fd5e3cd5d8dbf2754dc8a4fa611b89ef1a1e41c4556842b4daefa","observation_id":"45a057c9-7b32-491a-a426-4369c336c0ce","resolution":{"observed_at":"2026-08-02T15:38:00.391174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.395123Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.395123Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:3d43f548be3f8ab3629ab4179f6bfe022afd99d5471a57d2234314f23d4aa17e","observation_id":"c40114be-62df-4879-a0a3-9c32f514c65b","resolution":{"observed_at":"2026-08-02T15:38:00.395123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.399852Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.399852Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:d998f8d1530b33feeb6b2165a3be8f356bec4be36bbef4d6026e94bb2a2a8689","observation_id":"e4e4c121-51aa-4709-887a-9bd4237aa105","resolution":{"observed_at":"2026-08-02T15:38:00.399852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.404485Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.404485Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:52f169d42882e71ac67719af67cc25c82c8b8303a9fe37252cae67e314777d1a","observation_id":"27276313-a837-4dc6-a01f-9404f16bcdf8","resolution":{"observed_at":"2026-08-02T15:38:00.404485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:38:00.408861Z","title":"J]m | 3M6SL1 `֭N; ޤ Q4 t<묳q >d DF6I>T[ f v-֫ ?xj fڵ] bպFފ 8 Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T15:38:00.408861Z"},"links":{"citing_paper":"/paper/2604.23321"},"observation_digest":"sha256:d775f00a1655df66659b12ec29a8d3b26d6ecead2b04d26e3470a9b34b2ee791","observation_id":"541c426a-6413-4678-822d-15a9127f99ae","resolution":{"observed_at":"2026-08-02T15:38:00.408861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.23321","last_updated":"2026-07-29T16:19:23Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-13T09:41:21.198598Z","submitted_at":"2026-04-25T14:15:05Z","title":"MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2604.23321."}