{"as_of":"2026-08-08T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f6b4f9773f5b4441f8144bd1e618638afc13b439f6e424376b6dcabaefb5706","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:46.090733Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:30:14.559722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:49:36.602258Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-07T14:03:00.563577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.563577Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:2eeb2e82fd4051e1067031c3aa1f9d2aab66d6f591353df9836e52046cd26693","observation_id":"ee1ebd9e-a9c9-45ae-ae6a-38cd48861805","resolution":{"observed_at":"2026-08-07T14:03:00.563577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:a58f368489cf7c263270780bb2ac376f20e204eedb56cb97de1a8e10ca512b50","observation_id":"edbdef5e-892a-46ba-bff0-03e3b5d5177a","resolution":{"observed_at":"2026-05-18T14:11:27.464856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-04T13:51:42.554345Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T13:00:31.952588Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:8e1de767ae504739a83def96ca1491530261bf873625294b5de42e1debcc0989","observation_id":"913342ff-b8a1-4a73-8d70-b9dd8edb213b","resolution":{"observed_at":"2026-05-18T13:01:23.532492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T13:51:45.017918Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval.arXiv preprint arXiv:2505.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-04T13:51:42.554345Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.017918Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:fb86a820400986ef5595cb5acfd8cf6e41804cc5fa457806230f384c69424ba2","observation_id":"53c0bd72-bc9e-42d9-87d1-38ee6fc94016","resolution":{"observed_at":"2026-08-04T13:51:45.017918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:46:30.827346Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:aacc9ee1164880fa90ec65e1fa368a9748fdae12c19f0a887e31d4dccbac3984","observation_id":"aa897247-7e0b-4148-9f23-44169316f1bc","resolution":{"observed_at":"2026-05-11T19:01:19.736570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-12T18:31:37.144968Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T18:31:37.144968Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:4bc85c69d84c5e202027fd41afd9fad13e6a275720221226458302e057ab5897","observation_id":"8f2ce394-f8b1-45e9-893c-e0de3bc7989f","resolution":{"observed_at":"2026-07-12T18:31:37.144968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-02T15:40:29.161499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T15:40:29.161499Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:f537e81e4ab08ff3f53934d37d7d96f43319d5ccc7471817acca56dfde272fa1","observation_id":"1c769451-754c-4c00-a1c5-adf5685cc380","resolution":{"observed_at":"2026-08-02T15:40:29.161499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2604.25273","last_updated":"2026-04-28T06:29:27Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T06:29:27Z","title":"Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:56:52.714346Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.25273"},"observation_digest":"sha256:074ac5bc301755c3d4f1280db31c80e1c62f78e69600dd53343b47e0deb53b4a","observation_id":"8a9ccc3a-2e9a-4e11-9033-1cd3626b5ee9","resolution":{"observed_at":"2026-05-11T23:31:13.551343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-14T18:56:57.352952Z","title":"URL https: //doi.org/10.48550/arXiv.2505.19650","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.15868","last_updated":"2026-07-13T02:21:42Z","snapshot_observed_at":"2026-07-16T23:18:43.507326Z","submitted_at":"2026-05-15T11:36:01Z","title":"SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T18:56:57.352952Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2605.15868"},"observation_digest":"sha256:1de0a28d4f10aadc46b5c5adebc7bb8fec1a40d7ec5bd5aa386b34e8cd7162f1","observation_id":"8a5273d6-52b2-4e9e-9818-5a94e51accd8","resolution":{"observed_at":"2026-07-14T18:56:57.352952Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:21976e5128edbc36a0cf7d600ca6f7899081fc46814f453e4413acfc186940ec","observation_id":"19bd5014-640a-4ada-a4d1-8c375f21155c","resolution":{"observed_at":"2026-07-04T05:49:36.604036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T20:43:16.106644Z","title":"Modality curation: Building uni- versal embeddings for advanced multimodal information re- trieval.arXiv preprint arXiv:2505.19650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.106644Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:6db115af74fbe718b7f4c2aac7dfbb6cbd03f61d18b6b3c10bca4a59da55761c","observation_id":"68e4c1a0-4d0d-436a-b85c-8bffd421c7ac","resolution":{"observed_at":"2026-08-04T20:43:16.106644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-07T18:30:14.559722Z","title":"Glint Lab Fanheng Kong, Jingyuan Zhang, Yahui Liu, Hongzhi Zhang, Shi Feng, Xiaocui Yang, Daling Wang, Yu Tian, Fuzheng Zhang, Guorui Zhou, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06060","last_updated":"2026-08-06T14:04:56Z","snapshot_observed_at":"2026-08-08T18:16:29.989423Z","submitted_at":"2026-08-06T14:04:56Z","title":"Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:30:14.559722Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2608.06060"},"observation_digest":"sha256:facdd3c72f7ca0f2b0817f2220d4e1b9ac796b412692da2c31115b9f3005d981","observation_id":"8ba9a618-5492-42cf-be31-7c0106c94e0c","resolution":{"observed_at":"2026-08-07T18:30:14.559722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19650/citation-record","integrity":"/paper/2505.19650/integrity","json":"/paper/2505.19650/citation-record.json","paper":"/paper/2505.19650"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.135801Z","title":"Multimodal automated fact-checking: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.135801Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7620ba4567799789f8d16986e40911dbe3f56aee411502b5c4ef1fb67c2fcabc","observation_id":"d25bdf05-a782-4319-83d6-0091c3fc8af7","resolution":{"observed_at":"2026-08-07T14:14:37.135801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.194753Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.194753Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:4bf310ad455b6c403148e949b3ab59a944c9ff170f4d280e4433d0d70569f2bf","observation_id":"62a061c5-05f1-48aa-9003-4f4ff0a5f489","resolution":{"observed_at":"2026-08-07T14:14:37.194753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.236558Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.236558Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d0a59bdc4b6aab6c87df4ac911c94cc579ab1167ea9ec0221fd63db6f331804f","observation_id":"1880f482-8f26-4197-a149-8fc3aa7ba92d","resolution":{"observed_at":"2026-08-07T14:14:37.236558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01916","last_updated":"2025-04-02T17:19:59Z","snapshot_observed_at":"2026-08-07T16:14:03.064768Z","submitted_at":"2025-04-02T17:19:59Z","title":"FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01916","snapshot_observed_at":"2026-08-07T14:14:37.333584Z","title":"Finelip: Extending clip’s reach via fine- grained alignment with longer text inputs.arXiv preprint arXiv:2504.01916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.333584Z"},"links":{"cited_paper":"/paper/2504.01916","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:84ec07416f0b741d8931f9c927f7665acf99ce36fba3b48930287b80e0734b44","observation_id":"613f3f9a-f2c5-4326-be34-a86460cd5d22","resolution":{"observed_at":"2026-08-07T14:14:37.333584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:14:37.445117Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.445117Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:0aab1f8e21fcf4e9f5ca7b5ab59dfd425b8c9a153e5798ad3ce7cd6f0dd16234","observation_id":"47fa31f2-a075-4f07-b00d-96c42d4efb7c","resolution":{"observed_at":"2026-08-07T14:14:37.445117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-07T14:14:37.507574Z","title":"Ms marco: A human generated machine reading comprehension dataset.arXiv preprint arXiv:1611.09268, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.507574Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e645f79ad781119611790ecbbd156a60e49003ff6a777d40bec0d0ae9ab0e3b4","observation_id":"b81a194e-645b-4e3f-a99d-899caf53458c","resolution":{"observed_at":"2026-08-07T14:14:37.507574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.583688Z","title":"Wiki-llava: Hierarchical retrieval-augmented generation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.583688Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ea189cce69cd3ec73f48a247d49510cd4f81c7a88665d612aab0fa118f476f86","observation_id":"33c681ea-322c-4d07-9570-bf88a7f1e689","resolution":{"observed_at":"2026-08-07T14:14:37.583688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T14:14:37.686789Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark.arXiv preprint arXiv:2410.03051, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.686789Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c65103cec573fe019cc7327d535083a845d2f87fdfb5fd80a15ee96eaec719bd","observation_id":"caca77dd-0c7f-436f-a4a7-f8dbfe66e7db","resolution":{"observed_at":"2026-08-07T14:14:37.686789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.792978Z","title":"Webqa: Multihop and multimodal qa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.792978Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:66481004cdb8d38a44313066436819ca17f468a8ab61497d34092897277f988e","observation_id":"8e2aef62-91dd-4624-9d83-0869ab6c18e7","resolution":{"observed_at":"2026-08-07T14:14:37.792978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.877735Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.877735Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9e4b0a043371bad1ff213ed1970613181fdaa3663a6c3cd9d7fd05848215bee4","observation_id":"a17a1232-f62d-4dfb-8d2d-06f2228c2af9","resolution":{"observed_at":"2026-08-07T14:14:37.877735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-08T04:55:27.349420Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-07T14:14:37.978957Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.978957Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e60f0c8815d830e71d0e99452a770c6926818f467291b9a344a13db0eef7b093","observation_id":"14038995-ac3d-40b0-9f9d-34599cad0315","resolution":{"observed_at":"2026-08-07T14:14:37.978957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.039664Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.039664Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:98f62767137c06dfa878608d245935c6d66dd6dc72442305cbeed64f61fe6213","observation_id":"5ce443e8-645b-4c1c-864b-3fc15153c6aa","resolution":{"observed_at":"2026-08-07T14:14:38.039664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.135154Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.135154Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ec5ca771faff3aafb38106106ec37f8e5e1010298f3127cc369996c41c0a080f","observation_id":"cb626853-7142-459a-bb3f-07ee6af82e55","resolution":{"observed_at":"2026-08-07T14:14:38.135154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-06T23:46:49.824788Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-07T14:14:38.241872Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text.arXiv preprint arXiv:2210.02928, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.241872Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:21000d8b06efc61771de134b49b1126f61bfcf63bf1f70bb06ad26cb5ab7ad67","observation_id":"3abfb845-1d29-48d6-909d-845825214698","resolution":{"observed_at":"2026-08-07T14:14:38.241872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:14:38.335797Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.335797Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:13513c38d295402159ec9164d7b4ba8107fcf6bce3eb5f4fa036628f35d19af9","observation_id":"2ff154db-8bbf-46bf-91b2-fba69349d5dd","resolution":{"observed_at":"2026-08-07T14:14:38.335797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.353327Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.353327Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:12683933fda7e362c74f9e674e458dfd177fbdcc50423f42892d44f90ef59e87","observation_id":"55ade486-db11-43f2-b8c3-e76b36b8c472","resolution":{"observed_at":"2026-08-07T14:14:38.353327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.487073Z","title":"Visual dialog","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.487073Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d58d48231df5816a1aeb175d789e1704efad2e47d9638c7e774b57db9355aeb9","observation_id":"ce0df1fa-2f49-48a6-be40-6c7c99cc4813","resolution":{"observed_at":"2026-08-07T14:14:38.487073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.611355Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.611355Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:57c6fd729f3a5e748b1666dab285962c5659ccb7c1319950f14cd88b954b7b98","observation_id":"e03ce079-de1e-42e5-bb72-41a602d79443","resolution":{"observed_at":"2026-08-07T14:14:38.611355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.724894Z","title":"Mmdocir: Benchmarking multi-modal retrieval for long documents.arXiv preprint arXiv:2501.08828,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.724894Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1d0841402dd269c41e454f5c19bd43de234f4e5830db9a91868ff13b26967040","observation_id":"20feab99-8379-442e-816a-dc2af501376d","resolution":{"observed_at":"2026-08-07T14:14:38.724894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.857313Z","title":"The pascal visual object classes challenge: A retrospective.International Journal of Computer Vision, 111:98–136, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.857313Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7b4a2edec1d4d1799e3b5e6ca818332e94b710355effd0a22031df069edea2ae","observation_id":"6b9a2408-e4ac-48f3-913d-a09e84c5684c","resolution":{"observed_at":"2026-08-07T14:14:38.857313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-07T14:14:38.993221Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data.arXiv preprint arXiv:2306.09344, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.993221Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:339bcd640304d140a71f042a68c4fe9bc6b9e7b6da8f22b5183aa576a168f54b","observation_id":"a452dfd7-f6d5-419d-b6bb-18c1ba7ec49e","resolution":{"observed_at":"2026-08-07T14:14:38.993221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.124769Z","title":"Simcse: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.124769Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5fda0d761444c6bc55c08526c856e9c55f77c07896b438bac202b4d3a1aefe1a","observation_id":"56c6cc8f-ded3-4f71-a5b4-ad3cb8f4bb2b","resolution":{"observed_at":"2026-08-07T14:14:39.124769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.289062Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.289062Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f59deb99042938fb1f4e5f116d735c2a97b88f7e4e997083791254187b679eb6","observation_id":"7f0689e4-5de1-42e4-b919-de06d58519da","resolution":{"observed_at":"2026-08-07T14:14:39.289062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.416668Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms.arXiv preprint arXiv:2504.17432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.416668Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:00b2a9292120d4b9bbfeeb666183f9ed2b85e0e795735954fb97160b4d4093ba","observation_id":"9ada8643-244a-4f40-9648-261e9c3c503a","resolution":{"observed_at":"2026-08-07T14:14:39.416668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.525902Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.525902Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:66511d6ad57156cff63c3bd09d05a34b148b0a29d8ed07c70a107a36bbd6c30c","observation_id":"e76bd2ca-1ea7-42db-a61f-afaabef2ee8c","resolution":{"observed_at":"2026-08-07T14:14:39.525902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.674376Z","title":"Egocvr: An egocentric benchmark for fine-grained composed video retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.674376Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:761eadadb1730c2a5a90436189fa82f1e8b0585693541b4f14374bff19f6e021","observation_id":"d97d084b-ec3b-48e1-9ac2-4f3a6cb753ed","resolution":{"observed_at":"2026-08-07T14:14:39.674376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.787447Z","title":"Mate: Meet at the embedding-connecting images with long texts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.787447Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:aea9714e7bce37844eab90179f64e6e4e21f29a56bd2a207d8e2d6411b423325","observation_id":"adf2eed1-d342-476f-b3c2-12fcc2223410","resolution":{"observed_at":"2026-08-07T14:14:39.787447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.943808Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.943808Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6ebb9e885b09bbe554d1873e94ba149592c0e8806417d1a43f6d3fdc268ce3b7","observation_id":"1932084e-9cc0-4812-8e24-96947c515a18","resolution":{"observed_at":"2026-08-07T14:14:39.943808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.007625Z","title":"Tencent text- video retrieval: hierarchical cross-modal interactions with multi-level representations.IEEE Access, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.007625Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:38e40d97691945d30dc699d25994c8c182bfe0765dafe0793a1cf5744824f5cf","observation_id":"d567483b-84af-428a-9f33-3baca666fa76","resolution":{"observed_at":"2026-08-07T14:14:40.007625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.062977Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.062977Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:040f0aa68adadb76a3ec6f293376bbb586f1b124f420d438a8ce647951ea788f","observation_id":"69ea240f-4921-45fd-bd9a-8d749f023325","resolution":{"observed_at":"2026-08-07T14:14:40.062977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T14:14:40.135649Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.135649Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:aa83410d927a00f9781af38ed80d3418b3699e3661b0ba7ee9f0b9c97235b240","observation_id":"7c11c69d-5b64-4c24-bd72-49451fd8d076","resolution":{"observed_at":"2026-08-07T14:14:40.135649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-07T14:14:40.233513Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks.arXiv preprint arXiv:2410.05160, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.233513Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c6d1698fecd2500373bd90815b467f6e0864f865d7240e2ff31bf73e37e69ddf","observation_id":"ac76a1ed-3331-45f8-803f-635eead6ea98","resolution":{"observed_at":"2026-08-07T14:14:40.233513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.292912Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.292912Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a80da7320c312f68a140bc98f29788e67368d742600d3aa3037691e30be15349","observation_id":"67ea4878-8040-4681-b778-07b3235699d1","resolution":{"observed_at":"2026-08-07T14:14:40.292912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.422494Z","title":"Visual question answering: Datasets, algorithms, and future challenges.Computer Vision and Image Understanding, 163:3–20, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.422494Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:97c31f5fb71c2c6b348f890fe12dfec450449b505ec708beec56c71c0dcec8c4","observation_id":"92d103e5-e08d-4319-b296-89169c5ffde4","resolution":{"observed_at":"2026-08-07T14:14:40.422494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.496653Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.496653Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e46fc2e583e18cacb87cffd028d6f15833aa81a48bee4169784761c91371e388","observation_id":"291c51a4-7d5c-46bf-b507-49027c432b08","resolution":{"observed_at":"2026-08-07T14:14:40.496653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.596642Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.596642Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:cc457a60a3e2477ebc74dbb8189319193eed0e424706ab10fad7de1ba4ebacb8","observation_id":"0811a0e4-3d0c-4eb8-be38-e8d78780461e","resolution":{"observed_at":"2026-08-07T14:14:40.596642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20124","snapshot_observed_at":"2026-08-07T14:14:40.649758Z","title":"Tuna: Comprehensive fine-grained temporal understanding evaluation on dense dynamic videos.arXiv preprint arXiv:2505.20124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.649758Z"},"links":{"cited_paper":"/paper/2505.20124","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:0313231628401db45ba4f5bb4d8dedbe76710d28b007b95790532fe44df60419","observation_id":"e0a6ae9e-06f8-4ccb-b4df-16bb641e9b7d","resolution":{"observed_at":"2026-08-07T14:14:40.649758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.710060Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.710060Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:903106a2de7f05a8c2b86a24d59f76835204e3c7899e157f8c329095a9cbed3e","observation_id":"6e1e8e44-c342-4aad-a0f8-f9dd659c04b4","resolution":{"observed_at":"2026-08-07T14:14:40.710060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.831458Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning.arXiv preprint arXiv:2503.04812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.831458Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e1c574967ff157a70caf853b7c13d6d6fe721d0ffec5e12c6ae4299e996dfd20","observation_id":"28885696-1d45-4d01-9b13-455c7adb32cc","resolution":{"observed_at":"2026-08-07T14:14:40.831458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:14:40.926888Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.926888Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5ab9ba9b3b4a986ab68ef70fb00e595ab4a9b46717dea3e9b59b16f7ce1d1091","observation_id":"655aff41-ce43-41c3-8937-eba3fd1e8898","resolution":{"observed_at":"2026-08-07T14:14:40.926888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.027258Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.027258Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7bb531906ec16b999894784e8d0ba32c0b7acd33823c1e2e5c69cbe9c8d5e5bc","observation_id":"59753726-70b8-44bb-8bef-ba75c75e89e8","resolution":{"observed_at":"2026-08-07T14:14:41.027258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.096391Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.096391Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2cf23774fbfa4a4d113b01c50aed3ccbf5c5e3299adcf8e7e335381d33b9f118","observation_id":"5a365334-6104-47de-ad03-3b4afc2900d8","resolution":{"observed_at":"2026-08-07T14:14:41.096391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:14:41.208727Z","title":"Video- llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.208727Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:494e9ea197ab050fd44d5d32c4c5026befe3748d7967f366dc77346d6eff612d","observation_id":"9f723ea6-4cd0-4cd6-a9d8-b15993af6316","resolution":{"observed_at":"2026-08-07T14:14:41.208727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-07T14:14:41.299337Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms.arXiv preprint arXiv:2411.02571, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.299337Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:de9196f250b284a297a6bdefbcb9ff7ad98b6cc907e8199c99365a5a9a018308","observation_id":"a6817cad-c2f1-499f-afc9-97037fc12468","resolution":{"observed_at":"2026-08-07T14:14:41.299337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.369793Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.369793Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c1cefb8364582a5eeedd7cfd1c0005f1ef4aca25bdfc0294af8fbe51cdb30aad","observation_id":"67f62fc2-a81e-49fa-a515-6d3472ac5dd0","resolution":{"observed_at":"2026-08-07T14:14:41.369793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00954","last_updated":"2025-04-01T16:47:20Z","snapshot_observed_at":"2026-08-07T16:16:57.345878Z","submitted_at":"2025-04-01T16:47:20Z","title":"IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00954","snapshot_observed_at":"2026-08-07T14:14:41.513558Z","title":"Idmr: Towards instance-driven precise visual correspondence in multimodal retrieval.arXiv preprint arXiv:2504.00954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.513558Z"},"links":{"cited_paper":"/paper/2504.00954","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c7dda6753822b18f223d38a12cc68fabd2a080c34ac6c21138578522ab811093","observation_id":"551991ec-7975-4641-a0f8-c7238f90f6df","resolution":{"observed_at":"2026-08-07T14:14:41.513558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03743","last_updated":"2021-09-13T18:53:35Z","snapshot_observed_at":"2026-07-06T10:02:30.383493Z","submitted_at":"2020-10-08T03:07:00Z","title":"Visual News: Benchmark and Challenges in News Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03743","snapshot_observed_at":"2026-08-07T14:14:41.573083Z","title":"Visual news: Benchmark and challenges in news image captioning.arXiv preprint arXiv:2010.03743, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.573083Z"},"links":{"cited_paper":"/paper/2010.03743","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:48225afa9c7aca62ab826150e77aeecf232a33f04ff742b5c43e04bf76945922","observation_id":"e83cd7ee-0e9e-4b0d-a869-07c9dd7e76c4","resolution":{"observed_at":"2026-08-07T14:14:41.573083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.612473Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.612473Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:8dcbfaa8d729d6ed237028d82618f9b53ae8043f6737a07df8163eb02d7277c7","observation_id":"b3c57bc6-8e15-40d9-96aa-0c7f592a4b37","resolution":{"observed_at":"2026-08-07T14:14:41.612473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.651069Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.651069Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:002678dc00dc5e14f98c1918ba3e847301b3600d0483fcb176c9f3513612e239","observation_id":"659449bb-740b-47ae-9b37-96afcaccccd4","resolution":{"observed_at":"2026-08-07T14:14:41.651069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.752801Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.752801Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9231339a9f2594283a59b931b07b9cc8034a2d1f465f37e39e1a7ca203239b12","observation_id":"8f85b993-5da8-47b3-b77c-2a1152f5dbe7","resolution":{"observed_at":"2026-08-07T14:14:41.752801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.844748Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.844748Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2177668cd2ccf9053f1e13623eb49397043e3269b6d00fb6c3e9410288dde30d","observation_id":"7908fffa-9e17-4bd0-af99-c05ba6b87985","resolution":{"observed_at":"2026-08-07T14:14:41.844748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01720","last_updated":"2024-12-02T17:10:16Z","snapshot_observed_at":"2026-08-06T20:25:23.859209Z","submitted_at":"2024-12-02T17:10:16Z","title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01720","snapshot_observed_at":"2026-08-07T14:14:41.923753Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant.arXiv preprint arXiv:2412.01720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.923753Z"},"links":{"cited_paper":"/paper/2412.01720","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5c277c67487611fecd81e6605594feb12cc17c00734c17874d1e8d2d3705dfe4","observation_id":"923723cb-467f-45db-a2a1-8559ab4dc228","resolution":{"observed_at":"2026-08-07T14:14:41.923753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.986061Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.986061Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9043d3ee914e7cd27b740f79b8f224b469c88a3b4bbe6f269fd2035c95378aba","observation_id":"260b0014-20bc-4880-bd2e-ddd6d1537b45","resolution":{"observed_at":"2026-08-07T14:14:41.986061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.063940Z","title":"Generative multi-modal knowledge retrieval with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.063940Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2526869d0efa5588712227470ca1fc48df35efa440e6dc314225f38847b90752","observation_id":"a94f9504-f8e7-4bac-8e61-eff261c60a71","resolution":{"observed_at":"2026-08-07T14:14:42.063940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.139537Z","title":"End-to-end knowl- edge retrieval with multi-modal queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.139537Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f9021dbe9595b96c4f2605e94147075cdb9a141345ed7b829400c1261969375e","observation_id":"ee3f2b50-ba0a-43d5-a43c-54a563afc47a","resolution":{"observed_at":"2026-08-07T14:14:42.139537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.196435Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.196435Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:df9a343d2dbce193ccebf2b3c318e25b2dab2af39199d45b7e7787bea8db4172","observation_id":"6eeb2464-83a1-42c9-a2e2-7903dc66dde8","resolution":{"observed_at":"2026-08-07T14:14:42.196435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.277212Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.277212Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ecbb0e4995b6fc8e117ca9750eccac6c6bfeb2c4711ef404d7ee2aa48596427f","observation_id":"6b2f095a-1e1e-4972-9c8b-953e279d9a02","resolution":{"observed_at":"2026-08-07T14:14:42.277212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-07T14:14:42.381843Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding.arXiv preprint arXiv:2406.09418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.381843Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:155b5297f0f92e0f1e3cfd47c247c4438d0fbcf847f94010829a1ebb4594f12f","observation_id":"d8e194b3-da69-47a2-a2ad-e01cec6593b6","resolution":{"observed_at":"2026-08-07T14:14:42.381843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.469662Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.469662Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a9a899c11487756a665f2ccd7ec7c7b7face6e37ac39eac02b2913f30011bebc","observation_id":"4ab821c6-af25-475e-8c26-7541f1f79ee4","resolution":{"observed_at":"2026-08-07T14:14:42.469662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.534731Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.534731Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:24f4267c819cf5e182c1608cb46d17055212db02a6a4143766abb581b9b1fe3a","observation_id":"e2b4ea5b-3fde-419d-a747-7179956369f7","resolution":{"observed_at":"2026-08-07T14:14:42.534731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.612365Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.612365Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:90c40e452959e96228c60c0f2a2a856923b0fb0b0dbc8fa48ed3087cad6c10d8","observation_id":"023bd09b-026c-499f-8603-90db05775295","resolution":{"observed_at":"2026-08-07T14:14:42.612365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.664676Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.664676Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a030c389f9070ed3f270b50aaad136c892dbba992a934bef494ecbdf22005eb2","observation_id":"c140d83b-3342-4e5b-a369-99b7ede44866","resolution":{"observed_at":"2026-08-07T14:14:42.664676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.451662Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":"a2addd76-a36b-489c-b6d2-c51f1c683b2b","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.732833Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d385bb94258d0591f0b1853ae60aa846ba720481fe24aaa94d857b9036e26b5d","observation_id":"4d78713e-fe65-4b1c-b9c1-1e0f20828970","resolution":{"observed_at":"2026-08-07T14:14:55.493208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.301702Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"403132c8-1a9b-47a8-9c45-0514a42a8a8b","year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.803646Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3430bf38ddb6ccb64940555ca8f7556dd3c57aca27f0e7d273a3dd62a4f6a90e","observation_id":"ced10b56-ccc6-4d8e-a033-eb1cce907549","resolution":{"observed_at":"2026-08-07T14:14:55.391113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:14:42.931680Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.931680Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9ddc26b1a90c597f8bf182d5a0a6954f20273a7e6b0722b45d9b119145f947a7","observation_id":"49df6ac7-3954-48eb-b100-f5fc6a1d8b9b","resolution":{"observed_at":"2026-08-07T14:14:42.931680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:14:42.998277Z","title":"Kosmos- g: Generating images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.998277Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7dae42820bf09cd031957108654e03f8a015332564f6028de9fc29709c8cd3ba","observation_id":"0b9d012b-7ae5-462b-905a-907bb39c1e1c","resolution":{"observed_at":"2026-08-07T14:14:42.998277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.155801Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"278e484f-23ab-42bb-8c0d-796f2cb06265","year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.085408Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:332c46b9d3c36ea492a5ae24266871362aeb92fd27f9c07e3bcbace152f31909","observation_id":"d4c51ae5-fb47-48a0-91db-1ed9642c553b","resolution":{"observed_at":"2026-08-07T14:14:55.208547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.980937Z","title":"Filtering, distillation, and hard negatives for vision-language pre-training","venue":null,"work_id":"b9da9e9d-0b33-4dfc-b304-4ca32f134506","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.158713Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c84070391f26024c3cd4bf9755f075faa8bc98071983d1772aaea1dd4fcc021f","observation_id":"5496358f-8197-43d5-854a-cab5644921b9","resolution":{"observed_at":"2026-08-07T14:14:55.069133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.622831Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5c389ac2-953c-41b5-909b-c6a5af7ba45d","year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.236786Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d3cb3812dc6e6fc611d330881e71f09eac1141babdcd7c12eed5892040888d33","observation_id":"ca105a17-df5a-4e29-84df-50b64bd82dc9","resolution":{"observed_at":"2026-08-07T14:14:54.824769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.315704Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":"d55097f4-bb24-45c3-acfc-96cb5c74b697","year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.286893Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6506317702e755198d1f739e683fe738a3504641655df95efb9bf16d19e1f172","observation_id":"e597097e-88f1-46d8-b812-e0d643ff95d8","resolution":{"observed_at":"2026-08-07T14:14:54.517715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-07T14:14:43.344779Z","title":"Contrastive learning with hard negative samples.arXiv preprint arXiv:2010.04592, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.344779Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ffc962b126520788421a18996ed65c03d274b7685d278549b9be8207c8677a25","observation_id":"e021a51d-e594-4c22-9eb9-a07b0d2b105e","resolution":{"observed_at":"2026-08-07T14:14:43.344779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.065911Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"90fa1632-f6d6-4553-bc8c-b8d95caf394d","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.400909Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:408696c903ccfe8b89cf9ae42775bac5a9d039ff239b80a357c29ee08309e7cb","observation_id":"465889c8-cf34-48ac-9603-90480d251467","resolution":{"observed_at":"2026-08-07T14:14:54.171773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.790510Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"92b2f4cd-040a-48d5-8ce7-be938f0b9215","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.456451Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e6d7db9f15a496adf35904be028d091ee9627a3374dd36361c608c83f6bf8d0d","observation_id":"9c0da33c-6771-4f97-be58-70b508e1a057","resolution":{"observed_at":"2026-08-07T14:14:53.924513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.600561Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"464bea7e-e211-425d-8972-06cb7a289498","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.506063Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3a6f552ae66a0d0ea3a8e88535ee8f9530773739f0990c7f78e0228be7036399","observation_id":"410094f7-2180-4340-a721-0811d9523df3","resolution":{"observed_at":"2026-08-07T14:14:53.690728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T14:14:43.554578Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.554578Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6b5aca1f0baec8a68e2b528507bd96478aaaf18a95d68416fef2d3cfbb1ca2c1","observation_id":"1393e73d-2486-4a8e-9db2-783e9b418355","resolution":{"observed_at":"2026-08-07T14:14:43.554578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.413619Z","title":"Composed video retrieval via enriched context and discriminative embeddings","venue":null,"work_id":"f2ac1da6-34ad-4458-bfc5-f9a95d0d3fa3","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.611833Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:44b1dcc06a46ffe1adddd15f28b1ee5c3f07fd9f5493d78bc7c3aaae36f42248","observation_id":"4fc5fba1-6b55-444f-83ac-485e825a272f","resolution":{"observed_at":"2026-08-07T14:14:53.527330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.158097Z","title":"Fever: a large-scale dataset for fact extraction and verification","venue":null,"work_id":"31ab4e7f-1134-4afe-a0ad-5188ecd2455c","year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.665331Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f66eba52b72626ec1b575a7563c70fc3864f1022b06c845d33398f851051c5cf","observation_id":"9ddbad45-f0bd-4905-afec-10a0b6c37f36","resolution":{"observed_at":"2026-08-07T14:14:53.281847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.913421Z","title":"Covr-2: Automatic data construction for composed video retrieval.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"45ae2bf0-4dfc-444c-bfd2-3b4997a6de84","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.745704Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:97a4f63dc62f754a4188fed664bddf55ef9f47bc31271cb8dd85df62bf4c93a6","observation_id":"7e49834f-8235-49d4-ab1a-589f9b41a9d2","resolution":{"observed_at":"2026-08-07T14:14:53.036132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.724076Z","title":"Covr: Learning composed video retrieval from web video captions","venue":null,"work_id":"878b7cb6-dc5c-4d16-a97b-a3364d861d77","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.885501Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:69d98aecba93b84cebe30dd3f1a93d5019ea8b897146f8b011d98dd345233edf","observation_id":"43ac363e-3f70-45b1-b50d-cb55d8b92e58","resolution":{"observed_at":"2026-08-07T14:14:52.799218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-07T00:13:25.095002Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T14:14:44.083171Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.083171Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:54d1d61c6ec2701c1ba56eab57d934219fc1c34df0df630c8369881e27db2526","observation_id":"4165373e-c41e-4f73-bb44-aa18251c6109","resolution":{"observed_at":"2026-08-07T14:14:44.083171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06215","last_updated":"2016-07-21T07:20:44Z","snapshot_observed_at":"2026-08-03T01:54:39.800123Z","submitted_at":"2016-07-21T07:20:44Z","title":"A Comprehensive Survey on Cross-modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06215","snapshot_observed_at":"2026-08-07T14:14:44.181075Z","title":"A comprehensive survey on cross-modal retrieval.arXiv preprint arXiv:1607.06215, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.181075Z"},"links":{"cited_paper":"/paper/1607.06215","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:b68cfb1497c280d3ef3a2e79b958267c0c9f0d91629d66c4c54b2ddf081e9a4c","observation_id":"fa90b388-4267-4933-acb7-be02d1deee11","resolution":{"observed_at":"2026-08-07T14:14:44.181075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:14:44.311504Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.311504Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2332f1cbd1c210ce4d7411e50e169a7b181f38bf24e1ac1ffd23aad9ae17c1b9","observation_id":"112d2fbc-dfce-415c-9cee-36e5875b4c65","resolution":{"observed_at":"2026-08-07T14:14:44.311504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.510602Z","title":"Fvqa: Fact-based visual question answering.IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(10):2413–2427, 2017","venue":null,"work_id":"b508cb1e-de24-46f5-92af-e11253123de8","year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.452960Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a123239f693293b3536bb77132c3eac25b54a5de0f8f29d1d5f0741de8cf0e14","observation_id":"00e1ee86-7f82-4c3e-9637-2ac103fc5528","resolution":{"observed_at":"2026-08-07T14:14:52.620569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.331029Z","title":"Cross- modal retrieval: a systematic review of methods and future directions.Proceedings of the IEEE, 2025","venue":null,"work_id":"7315282b-7593-4a5f-a840-f86ff7301b94","year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.602734Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1ddb418b673fb66b08144a45d1543269ea91daa7f68f93c41a823d3478bc481d","observation_id":"f7e16bdf-8b49-4887-aea7-5fe6a581e0f8","resolution":{"observed_at":"2026-08-07T14:14:52.402528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.083149Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"75b8c8cc-1ba5-4476-a7c9-7d88d3879508","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.751774Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:15f1aee4f4c768ab4e935dc3c2d8c6e377d89276b0c5128838289e8015847c2e","observation_id":"22241213-305e-4750-a912-386dc00fafc9","resolution":{"observed_at":"2026-08-07T14:14:52.210759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.885577Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"aa44966f-922b-4983-8e10-72868f427548","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.896788Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1352181a07da05f8ec0bca3feb9bc13d3e654e6885b299e1ab39628c7f3c6b9a","observation_id":"1ccdfecc-be1c-4081-870d-5ebf432c8179","resolution":{"observed_at":"2026-08-07T14:14:51.966932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T14:14:45.013607Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.013607Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:fa8586d2e4eb954c1df08384d3e20218b4987fba4b241f11b42e8f9bf4fffdbb","observation_id":"c92fe79b-13d1-4bc5-a59a-c97df7637a2d","resolution":{"observed_at":"2026-08-07T14:14:45.013607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T14:14:45.104101Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.104101Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7ee1721a4eb5fbc6612a635de1afde6833961fa01c295d05267e90f144adc732","observation_id":"f54c8e76-bdc0-480b-9fc8-a497a0ec08de","resolution":{"observed_at":"2026-08-07T14:14:45.104101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11895","last_updated":"2024-07-16T16:24:31Z","snapshot_observed_at":"2026-07-06T18:47:17.428629Z","submitted_at":"2024-07-16T16:24:31Z","title":"OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11895","snapshot_observed_at":"2026-08-07T14:14:45.187968Z","title":"Omnibind: Large-scale omni multimodal representation via binding spaces.arXiv preprint arXiv:2407.11895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.187968Z"},"links":{"cited_paper":"/paper/2407.11895","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:4aa955dcaff5d2cfaa237b50be1b1db539feb246f670d85cf764286deb0c272c","observation_id":"e20025dc-ed00-4245-aed1-d7b7f54c7576","resolution":{"observed_at":"2026-08-07T14:14:45.187968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.685648Z","title":"N24news: A new dataset for multimodal news classification","venue":null,"work_id":"07f5fe1a-e9c8-4392-b267-abc4f0c15e07","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.273016Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:de310a3a95d19f39b38755783e4a4a7683d49504a42c0b65568cdc45bcd83f6c","observation_id":"4dc596e4-9b13-4caa-9b6a-29a932e200f5","resolution":{"observed_at":"2026-08-07T14:14:51.794730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.514776Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":"34061f01-83d6-4edd-8eef-7bd9382106c7","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.369387Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9cb6925a58bc7b75e57ce0036757b4b1c043d8c74065b3fd4f6ec41c40f175e7","observation_id":"2c6dc2a6-8756-4a3a-bc80-de2df8aaa6c1","resolution":{"observed_at":"2026-08-07T14:14:51.598369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.339906Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"13b27ca3-8839-4c7e-85f4-2418c1f23054","year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.437690Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f74f924c3a0a65036ac264dd7598baf03b71cbdc31f22c733d88167b750b8cfb","observation_id":"0ccbf610-017b-47cf-a0cf-93ed9d61fcfd","resolution":{"observed_at":"2026-08-07T14:14:51.405208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00808","last_updated":"2020-10-20T22:17:19Z","snapshot_observed_at":"2026-08-06T15:45:53.027828Z","submitted_at":"2020-07-01T23:15:56Z","title":"Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00808","snapshot_observed_at":"2026-08-07T14:14:45.558531Z","title":"Approximate nearest neighbor negative contrastive learning for dense text retrieval.arXiv preprint arXiv:2007.00808, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.558531Z"},"links":{"cited_paper":"/paper/2007.00808","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:8de404842b2896a7a9e6dc6babcf4471477acef8b4521ada0558d1e4f56b503c","observation_id":"b10f7c85-ecde-490e-acd6-857b03f829f8","resolution":{"observed_at":"2026-08-07T14:14:45.558531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.165956Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"109b560f-413b-41d1-83a0-52b20e484cec","year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.631311Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:fd1fbcbb89899c86eef6337325a5c00dc3af4a57038fb1ea34d308e4bf5e2f62","observation_id":"fafc94c8-f7eb-405c-bbee-bdbf296ecd29","resolution":{"observed_at":"2026-08-07T14:14:51.233064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:14:45.703524Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.703524Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9f7343c95f485d18bebb33a1516b97a5abf62ae90cf77b7aaac05eeee6892718","observation_id":"731ad417-6323-44dd-8cd0-da784f786d16","resolution":{"observed_at":"2026-08-07T14:14:45.703524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-07-06T20:15:13.182552Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00513","snapshot_observed_at":"2026-08-07T14:14:45.772749Z","title":"Fine-grained video-text retrieval: A new benchmark and method.arXiv preprint arXiv:2501.00513, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.772749Z"},"links":{"cited_paper":"/paper/2501.00513","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5968686655db51cfb3577661395b4dc804b12b170ee8c12858f46c51d1b57ca8","observation_id":"ff5b82ca-a31b-43ae-aebe-5614bf80505d","resolution":{"observed_at":"2026-08-07T14:14:45.772749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T14:14:45.839239Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.839239Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:fae4ab1550122a0dbaa99eb5b125bee753a86ae21d58068b9aec91bc107527f3","observation_id":"5f71f51c-5bf3-4289-8e15-5670d5225064","resolution":{"observed_at":"2026-08-07T14:14:45.839239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:50.887260Z","title":"End-to-end multimodal fact-checking and explanation generation: A challenging dataset and models","venue":null,"work_id":"e30979ee-7fee-4919-b040-28f8a8744539","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.930404Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:bd58d17c86d7e8aad143d2d0d1c3ad81b5677a25692acd319a13c9ee77d3603e","observation_id":"0da0f99f-033f-4503-b951-6c6d25f52ded","resolution":{"observed_at":"2026-08-07T14:14:51.025254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:14:46.015018Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.015018Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:84f09bd0681233cc31111cbe2f51dddeb8d072049d1eec536275cca19b6ce54a","observation_id":"0b5c142e-69e9-4709-91ce-7bed037176bb","resolution":{"observed_at":"2026-08-07T14:14:46.015018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19900","last_updated":"2025-03-25T17:57:17Z","snapshot_observed_at":"2026-08-07T16:37:36.089033Z","submitted_at":"2025-03-25T17:57:17Z","title":"CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19900","snapshot_observed_at":"2026-08-07T14:14:46.090733Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning.arXiv preprint arXiv:2503.19900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.090733Z"},"links":{"cited_paper":"/paper/2503.19900","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9f2ffe3dff4cca7c9375f7f3e3fa709361d12dfc61139dbd0e6406892a8b5cfd","observation_id":"25d936f7-e057-4d04-b373-1597cff5eec4","resolution":{"observed_at":"2026-08-07T14:14:46.090733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 12 inbound Pith citation observations for arXiv:2505.19650."}