{"as_of":"2026-08-21T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2547491eb52ceb1143c9d3143c9024b448cf8a32a7ba5cede0d3e0a269d57850","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:20:59.229137Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.05275/citation-record","integrity":"/paper/2602.05275/integrity","json":"/paper/2602.05275/citation-record.json","paper":"/paper/2602.05275"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T04:20:50.269672Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.269672Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:076960548c1c8eb19f077be4bb6d5333262f2bec3e591c9cf53f6ac420e7ae46","observation_id":"166a2c47-85ae-4c04-906c-9eee29fe86a9","resolution":{"observed_at":"2026-08-03T04:20:50.269672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.328330Z","title":"Coig-cqia: Quality is all you need for chinese instruction fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.328330Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8ae4db3156d2d33e5cb83cd5de20b379dbc97bdde67e3c5714ae2a9bd55c4cad","observation_id":"be59d751-9b27-45f1-93fc-590044a5f705","resolution":{"observed_at":"2026-08-03T04:20:50.328330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.405091Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.405091Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:f1c11fcf4c423ee39a673d3a49e29d7b87ff8eedb3f71ac1c09499bfb9a0c36a","observation_id":"05d1e918-7453-4f08-aeda-dba483f41331","resolution":{"observed_at":"2026-08-03T04:20:50.405091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.489896Z","title":"Baai-mtp dataset","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.489896Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:d76a06bdce5db90a91899a8b4c71ac43b1044ac302263de6f46a2804f0df35ed","observation_id":"8d3a293f-257b-4725-9561-cd6f6ba388f5","resolution":{"observed_at":"2026-08-03T04:20:50.489896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11927","snapshot_observed_at":"2026-08-03T04:20:50.578691Z","title":"Flame: Frozen large language models enable data-efficient language-image pre-training.arXiv:2411.11927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.578691Z"},"links":{"cited_paper":"/paper/2411.11927","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:047a8e971701377986c2fc5284fb19232150b0636d2a593206ae0c66dc525986","observation_id":"dccbc202-eb71-431c-a90a-e929ada7b54e","resolution":{"observed_at":"2026-08-03T04:20:50.578691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.649295Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.649295Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:bdb204647a49f5fb6cafed1c3b120288d793111ed2816564213dd5b75f20cae0","observation_id":"b69c64be-4bfc-4880-8c75-5a0d9ff684d0","resolution":{"observed_at":"2026-08-03T04:20:50.649295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.726553Z","title":"Webqa: Multihop and multimodal qa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.726553Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:f4e6b31e604338a725c2123854792241bede2c35b561bb2df0f2ba1cfd7c2db5","observation_id":"7868e2cf-7529-46d5-b645-eb23bab88664","resolution":{"observed_at":"2026-08-03T04:20:50.726553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-19T02:58:55.434817Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-03T04:20:50.826332Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data.arXiv preprint arXiv:2502.08468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.826332Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:4cc74fdea329da5ac0feb76b5f90ebc77478d0e03adf1b030f80586bf4999eda","observation_id":"9c243006-424a-4db2-b9c6-014a5ba99d4d","resolution":{"observed_at":"2026-08-03T04:20:50.826332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:50.986221Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.986221Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:6b2061ce6cf6a9ba5aa958ab81f4648772d9955c1552cd302b3e2e33d8776d6b","observation_id":"2335a39d-00c1-49f2-ada7-3d9eccb47a02","resolution":{"observed_at":"2026-08-03T04:20:50.986221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07143","last_updated":"2024-07-13T14:20:07Z","snapshot_observed_at":"2026-08-18T07:59:02.349146Z","submitted_at":"2022-12-14T10:24:50Z","title":"Reproducible scaling laws for contrastive language-image learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07143","snapshot_observed_at":"2026-08-03T04:20:51.146796Z","title":"Reproducible scaling laws for contrastive language-image learning.arXiv:2212.07143, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.146796Z"},"links":{"cited_paper":"/paper/2212.07143","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:0e847915ae901465520461b13d0bab9b08bfd61d280fdf3c95a7d4c30e512e24","observation_id":"acab2e52-707d-4483-a256-c636ab96fd9b","resolution":{"observed_at":"2026-08-03T04:20:51.146796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.273014Z","title":"Think then embed: Generative context improves multimodal embedding.arXiv preprint arXiv:2510.05014, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.273014Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:4c69f7199d15fb4be8b691f371a1f75bc732d22dcbc8dc4f0c3d9298a2dc9ec0","observation_id":"7ce5ec27-ebf6-4054-8c4b-ab3e8b33442d","resolution":{"observed_at":"2026-08-03T04:20:51.273014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.393186Z","title":"Visual dialog","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.393186Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:d6ebfb8807682d53f509828b7bdff19b2fd1528fba5a0512abb9474e875c74c5","observation_id":"24da3b8c-1f04-49fd-abd6-26b21d0ed7f5","resolution":{"observed_at":"2026-08-03T04:20:51.393186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.514888Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.514888Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:ffdc7f1d021a6130a9d8b1e82d9278a057428d5b00e929fc70c56e7d4abeafaf","observation_id":"3afd858a-3cbb-45c8-9c88-1b34042db5d1","resolution":{"observed_at":"2026-08-03T04:20:51.514888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.658647Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.658647Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:a386e11377a613677813d4dc4b7c8e1e5c51d69adc652eb8eca22669e074eba6","observation_id":"48688fd7-db64-449c-a223-2b57973041c5","resolution":{"observed_at":"2026-08-03T04:20:51.658647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.796555Z","title":"Pact: Pruning and clustering-based token reduction for faster visual language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.796555Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:63dd8b8b12b705d716ed2d289b3ffb45122203e623d564332266b28b78e37f56","observation_id":"179adbdc-b9d6-47a0-a487-8597ebc8b8b6","resolution":{"observed_at":"2026-08-03T04:20:51.796555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:51.902230Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:51.902230Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:6749b761f7be7e637dacab79e6979a75c5eb959aef8d42c61d780b2ee4844b41","observation_id":"31325f37-7599-413e-91ee-3397c878c3b1","resolution":{"observed_at":"2026-08-03T04:20:51.902230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:52.014405Z","title":"The pascal visual object classes challenge: A retrospective.International journal of computer vision, 111(1):98–136, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.014405Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:021c814089899ddba56d54baf34155953de9aca2b0c3c1172bdb4fd3ce31af7a","observation_id":"43981ea6-2a2e-434c-a555-09f7d8b36f02","resolution":{"observed_at":"2026-08-03T04:20:52.014405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-08-20T16:22:11.790225Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-03T04:20:52.116209Z","title":"Colpali: Efficient document retrieval with vision language models.arXiv preprint arXiv:2407.01449, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.116209Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:cc68d65a6273a0db5724e2ee8b60a398454930df97d2503576d39a885b88c9ca","observation_id":"46bf6137-d634-43fd-a7ac-5214bd75eebb","resolution":{"observed_at":"2026-08-03T04:20:52.116209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-17T00:52:15.316289Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-03T04:20:52.280678Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data.arXiv preprint arXiv:2306.09344, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.280678Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:e4146da2389b3fab99910daee91d303ef6f714140e2ff0edd9568ca9086091a2","observation_id":"183a65f1-5665-498b-9cbf-7a05848fb385","resolution":{"observed_at":"2026-08-03T04:20:52.280678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:52.411606Z","title":"Vl-clip: Enhancing multimodal recommendations via visual grounding and llm-augmented clip embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.411606Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:b521e40a332dddd34c4574efc55b70cce24bb19ea34341424154db166e47190c","observation_id":"36da3974-7e5d-4c11-8b8a-6abe816d0e2d","resolution":{"observed_at":"2026-08-03T04:20:52.411606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-18T09:10:03.802508Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-03T04:20:52.540683Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data.arXiv preprint arXiv:2410.18558, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.540683Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:74d7b2d9a2b01c686cc3e585e3818237124abdc1e6e926be7c319104bfc52471","observation_id":"ae888698-4138-4df4-bfa0-ca4c4b4bc9d8","resolution":{"observed_at":"2026-08-03T04:20:52.540683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:52.677077Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.677077Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:c7ab64a34f22e7ff1016443ec3ca7e960412d22a3a54f71476d279225f5bed13","observation_id":"6d04b80f-cadd-4690-bdf0-76de269deeb4","resolution":{"observed_at":"2026-08-03T04:20:52.677077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:52.837118Z","title":"Unime-v2: Mllm-as-a-judge for universal multimodal embedding learning.AAAI, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.837118Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:ec754b842a9154baa8cdc76b961fe4ad12d2680f564cd491b65e1dd9f72263c3","observation_id":"09dd4733-71ab-4e64-9960-30af4ee00814","resolution":{"observed_at":"2026-08-03T04:20:52.837118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:52.965109Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:52.965109Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:a9447a3454fb5e7c7aaec2cf39cbd566161c88c84dad5be6b39b5a61026141ab","observation_id":"fa8ff887-223a-4a26-965b-f40dcfcec6f0","resolution":{"observed_at":"2026-08-03T04:20:52.965109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T04:20:53.053118Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.053118Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:62f453699d602c6b0939da178fec107541373a8057d5843f2e7ecf9773c9de7f","observation_id":"82da0299-3d75-4c2d-ab49-b347be8f59b6","resolution":{"observed_at":"2026-08-03T04:20:53.053118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.141125Z","title":"The many faces of robustness: A critical analysis of out-of- distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.141125Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:e898f7a54565fd2a0a5e0f97a86ce294c34299687d37d46714668a9f21bedd12","observation_id":"96a5728c-d82b-42ed-b2c6-63046e03b7c3","resolution":{"observed_at":"2026-08-03T04:20:53.141125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.211095Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.211095Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:afdb0a3781c2c834e9bf52bf9ba84105997b77b4069f2a09e186617adb780687","observation_id":"d99ed3e6-fe96-4b1b-8de8-809fbf6fa007","resolution":{"observed_at":"2026-08-03T04:20:53.211095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.278887Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36:31096–31116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.278887Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:e4db71b92a33c16f594ecbbd0965015fbfd34237b40c8b3183722e8d07734f69","observation_id":"5d802671-6139-46ae-a30b-c63e2d2b8bd8","resolution":{"observed_at":"2026-08-03T04:20:53.278887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.357148Z","title":"Open-domain visual entity recognition: Towards recognizing millions of wikipedia entities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.357148Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:b33d494440e4046c41a8938391e85bcf4da7f1c44917fb511d6385db6427cc6b","observation_id":"91081082-ff54-49d8-b4d1-911425dcc288","resolution":{"observed_at":"2026-08-03T04:20:53.357148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.430200Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.430200Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:09892c239d331cba00885984e85e0edbf41330a0f4ec41277d673a83f170de35","observation_id":"cfb612ed-935a-4f4b-80d7-b1570230c04f","resolution":{"observed_at":"2026-08-03T04:20:53.430200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05874","last_updated":"2025-05-28T18:14:55Z","snapshot_observed_at":"2026-08-20T12:11:15.199558Z","submitted_at":"2025-01-10T11:17:15Z","title":"VideoRAG: Retrieval-Augmented Generation over Video Corpus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05874","snapshot_observed_at":"2026-08-03T04:20:53.503874Z","title":"Videorag: Retrieval-augmented generation over video corpus.arXiv preprint arXiv:2501.05874, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.503874Z"},"links":{"cited_paper":"/paper/2501.05874","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:30202c308c792d060a804f78f49a603de94252b363bc9ab56e0516cd80e5d7fc","observation_id":"8bc95e34-6faa-4aaf-8c14-fbb97c7c3366","resolution":{"observed_at":"2026-08-03T04:20:53.503874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.580062Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.580062Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:c980b547a65bc323f8381711f0f185f8eaa85b124409e443cfb7315cdafb6737","observation_id":"acb3f71a-b666-48ae-aaf1-634564865cbe","resolution":{"observed_at":"2026-08-03T04:20:53.580062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.640896Z","title":"Rzenembed: Towards comprehensive multimodal retrieval.CoRR, abs/2510.27350, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.640896Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8f33cb698886d7008af0662d333f92608b338016008a4e219ed9e4d9d843f7c0","observation_id":"977c4326-5f16-48ca-b8b6-6358a3d87dcf","resolution":{"observed_at":"2026-08-03T04:20:53.640896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-17T17:47:50.871594Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-03T04:20:53.698736Z","title":"E5-v: Universal embeddings with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.698736Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:545e100efbaa7756be7370a5e62cb0166f52d6d21274dc50a9914e09eb718ea5","observation_id":"d9095c6f-3ea3-4a98-b77b-b176b4c5dc82","resolution":{"observed_at":"2026-08-03T04:20:53.698736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.795182Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks.ICLR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.795182Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:c7133450020ef9c525d475cd8eb415093ef8495aa5190888097e28744680c1c4","observation_id":"12f5a73a-ca73-436e-acd4-ea478d6def41","resolution":{"observed_at":"2026-08-03T04:20:53.795182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.858465Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.858465Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1ab3d9d0732b1e0d553b66a05de09ae3cfdca7ab1ea51c802e2030bd6a0b4c94","observation_id":"25b78c6e-7297-431e-842c-9149d7217160","resolution":{"observed_at":"2026-08-03T04:20:53.858465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.910519Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes.Advances in neural information processing systems, 33:2611–2624, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.910519Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:337e9f43d013fe1884e634b393d7044ad9efdc0bfb79a972299a927c28feb5f7","observation_id":"dd25e9aa-bbbf-412f-b772-e53181d135bc","resolution":{"observed_at":"2026-08-03T04:20:53.910519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:53.976937Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.976937Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:34751a8c94078c9be7e11e5936ad0477d25228d505adefec0fceaa78b3444557","observation_id":"f8b59236-ee56-45db-b021-deaa1d229b16","resolution":{"observed_at":"2026-08-03T04:20:53.976937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.032303Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.032303Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:44ce7157504eebd4173724b75d0bfc08b2387b0c31c301f2c1b6954e6b8f18e5","observation_id":"9ba3d8cc-e5eb-4ab6-b1c9-027339cbd6c6","resolution":{"observed_at":"2026-08-03T04:20:54.032303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.086589Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.086589Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:b008f6fbbfb95ccb7c39eb22c414de233cf7c6756a9feebc038f2e7e496d7119","observation_id":"213c22ef-aa82-46dd-97b9-45934dc05b11","resolution":{"observed_at":"2026-08-03T04:20:54.086589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.147896Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning.CoRR, abs/2503.04812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.147896Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:15070bc12a06b518d6662b456b5de0972bf5e779687c9edc5155d30cfcd5a8f6","observation_id":"7c4ddbba-ec11-4314-9fdd-3a0ff0b81ff3","resolution":{"observed_at":"2026-08-03T04:20:54.147896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.207577Z","title":"Ume-r1: Exploring reasoning-driven generative multimodal embeddings.arXiv preprint arXiv:2511.00405, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.207577Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:06403254b0f39b9ba25aca93a93caf1156879eaabc21912543fb325af86b363e","observation_id":"929d70e2-7b2a-48cc-a0c1-b4a09760ae73","resolution":{"observed_at":"2026-08-03T04:20:54.207577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-18T01:32:03.254930Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-03T04:20:54.248497Z","title":"Building and better understanding vision-language models: insights and future directions.arXiv preprint arXiv:2408.12637, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.248497Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:2ad80399cb850abf44b600613df7b4624810475446116fa10774a6e434503e92","observation_id":"d1a1b7cc-4327-4d06-8e40-7aaa6efa2abc","resolution":{"observed_at":"2026-08-03T04:20:54.248497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T04:20:54.294979Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.294979Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:f6b671da8232e25082d92b78169f12d16554a1942e97320f157d0686aa7a7353","observation_id":"8737e8ec-8fc9-461a-97ec-70b28ff7d280","resolution":{"observed_at":"2026-08-03T04:20:54.294979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11116","last_updated":"2025-06-09T06:37:15Z","snapshot_observed_at":"2026-08-15T22:47:41.272189Z","submitted_at":"2025-06-09T06:37:15Z","title":"Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11116","snapshot_observed_at":"2026-08-03T04:20:54.360576Z","title":"Infinity instruct: Scaling instruction selection and synthesis to enhance language models.arXiv preprint arXiv:2506.11116, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.360576Z"},"links":{"cited_paper":"/paper/2506.11116","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:7152fcdd463f8a1dfa29e67964b15066df041b1682c487d8410e92164faec2c7","observation_id":"28e058cf-59cc-429f-a3e6-6b3e1948a423","resolution":{"observed_at":"2026-08-03T04:20:54.360576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.428984Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.428984Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:e5bd522d05d5ecdf0d4cc5bc86bfe1124f6ca449ea1ca0fed8a49992c4234253","observation_id":"2b1f1732-8e9b-4c7c-97ae-e17119a92bef","resolution":{"observed_at":"2026-08-03T04:20:54.428984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.527590Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.527590Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:a345aa481982e75448b85113cb0c2b3724de0afaa4936c2f1278577388dfa328","observation_id":"1f1bd9c3-28b3-4f0a-9308-6f87286f58e3","resolution":{"observed_at":"2026-08-03T04:20:54.527590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-16T14:34:02.863082Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-03T04:20:54.615173Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.615173Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:35262fefc394489b52cd4c72ae3704c956e680f98d44edea369b36f2ef3da2c3","observation_id":"bcfcfc53-0e48-4a26-963a-ef15269b830b","resolution":{"observed_at":"2026-08-03T04:20:54.615173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-08-14T12:22:57.900954Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-03T04:20:54.697053Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking.arXiv preprint arXiv:2601.04720, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.697053Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:bef5c7f41f2cf278f38c7afcb8e3ad5727acf626fecd3e33ce1e781667ca441b","observation_id":"fc433143-8e98-4778-8378-95c28f42aceb","resolution":{"observed_at":"2026-08-03T04:20:54.697053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.749572Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.749572Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:d411c9301da5aa71c8b0704aea0637105f47ec2ec061c0c7b0182ac99d782b2b","observation_id":"f805cdb2-ece6-4b0e-ad8e-6766ace1d552","resolution":{"observed_at":"2026-08-03T04:20:54.749572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-21T10:39:36.642494Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-03T04:20:54.793364Z","title":"Mm- embed: Universal multimodal retrieval with multimodal llms.arXiv preprint arXiv:2411.02571, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.793364Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:caaca9f5fb2618850d52c6ec9352b5c1289947f69c79446c67327452d512ab23","observation_id":"dd0e4e57-7762-4cbd-815f-a76f08928956","resolution":{"observed_at":"2026-08-03T04:20:54.793364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.860381Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.860381Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:cf2fbffa2c44d1d6401d5227e6820b4e0e1abad00c80232d9cdfa794d79d4b4d","observation_id":"8c2cb28b-4ad8-41a6-9bed-55a112eca2a0","resolution":{"observed_at":"2026-08-03T04:20:54.860381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.915681Z","title":"Gres: Generalized referring expression segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.915681Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1f72bd98f232effddcde3c8a6d935a58ad0c34032060e85d4010a0457ba914f9","observation_id":"9143fca5-9bfc-428a-a83b-e062fc6b8bf0","resolution":{"observed_at":"2026-08-03T04:20:54.915681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-03T04:20:54.954439Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.954439Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:ac1b7d73b4a56e7be5192566a9e8ac9757ec6c7efefc4b28d34f451fce7044af","observation_id":"190b143f-5bb8-4e52-b0fd-96324161291e","resolution":{"observed_at":"2026-08-03T04:20:54.954439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.043738Z","title":"Visual news: Benchmark and challenges in news image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.043738Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:236387355baa4dce885709fe7f1af907e90e7a8566e6f6437bba4ced3af39b5c","observation_id":"2de17b5a-c7b5-472b-9aba-918622fe9e6f","resolution":{"observed_at":"2026-08-03T04:20:55.043738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.111831Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.111831Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:23311a4a0f777188d96c5bfdfc977bc811c7ae3a10f73d5f6b14e41da822418b","observation_id":"12f91ffe-ddfb-400a-bc06-bee301d4359a","resolution":{"observed_at":"2026-08-03T04:20:55.111831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.197386Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.197386Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:0af116ef7721ef5f1ff2fae436ff2afab17f90304d430e230b11bbb8df5ea709","observation_id":"7f072e3e-75bf-43f4-a3e2-bcaf95f242df","resolution":{"observed_at":"2026-08-03T04:20:55.197386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.280158Z","title":"Edis: Entity-driven image search over multimodal web content","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.280158Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:dac8f2f43ef30fe1691bed183a11b4ae184c206477db52e6c73a6ab8a9996480","observation_id":"c2c6451b-e443-4568-9f64-85f32a287c39","resolution":{"observed_at":"2026-08-03T04:20:55.280158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.374183Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant.CVPR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.374183Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:7f6c65d9ff11b046adec966ff0365db8bb3242860fc2142173c115fa945aecc9","observation_id":"00fcc7cc-c367-458a-93c4-218c97b71f19","resolution":{"observed_at":"2026-08-03T04:20:55.374183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.501729Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.501729Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:226c06360428879a4e75fd1599a0718b34383bc2a9fefcc5f7c823a8fe4d9135","observation_id":"95a0d4ea-cc76-44ac-9e27-733a7b3bd8cb","resolution":{"observed_at":"2026-08-03T04:20:55.501729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.620998Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.620998Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:d6818ada35e11392da9a4b24a0404254d9ff31d2c08c89864ca445a5c3c835a5","observation_id":"a45aa92c-f61c-4a21-931f-c62c279a5b61","resolution":{"observed_at":"2026-08-03T04:20:55.620998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-03T04:20:55.730245Z","title":"Unifying multimodal retrieval via document screenshot embedding.arXiv preprint arXiv:2406.11251, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.730245Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8d45a9ac35d60f9caff508c1a1e70775ab7360472db2eb39c615f7c6cacde60c","observation_id":"58ad22d6-b653-4236-9404-83176f58b5ae","resolution":{"observed_at":"2026-08-03T04:20:55.730245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.841007Z","title":"Visa: Retrieval augmented generation with visual source attribution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.841007Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:08306569fff4dfa6018218363891e03b4fed7c2cbdb1f4a9e792369addca3a1e","observation_id":"b18985b3-4092-4a88-8509-22269840a629","resolution":{"observed_at":"2026-08-03T04:20:55.841007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.954787Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations.Advances in Neural Information Processing Systems, 37:95963–96010, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.954787Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:0fd6401da066cf3995e33b72e9c9f5b4946ceda7c82787686611be010f292680","observation_id":"86b9a751-c795-4086-9ac3-21f8e45aeff7","resolution":{"observed_at":"2026-08-03T04:20:55.954787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.034599Z","title":"Vidore benchmark v2: Raising the bar for visual retrieval.arXiv preprint arXiv:2505.17166, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.034599Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:be9b0eac4e42157f007d43465531c11b4298b2f56e0943d7a62df521dbac5a15","observation_id":"c34fcdb9-e9d0-496e-b7d3-556391baf8b7","resolution":{"observed_at":"2026-08-03T04:20:56.034599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.106545Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.106545Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8bdf0cb8f24250a21f5eb9f4e22da30c26011b102ff08dc109cd92f49d9b27e5","observation_id":"7064aa75-1c13-4bb3-b89f-41d8c54ce929","resolution":{"observed_at":"2026-08-03T04:20:56.106545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.179526Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.179526Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:20d152d9e63c4cea5bd31dfadbfd16915241b98d9702c1eff4e09f5f8a5fb093","observation_id":"b8adf7aa-019e-4dbc-b2ac-7fc6aa70587c","resolution":{"observed_at":"2026-08-03T04:20:56.179526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.278664Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.278664Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:d8fc0154d52e1cfcc85790aa91c1de8faaa6f794509a689d715512d2fc1c2117","observation_id":"c3f7e06e-2efe-48a1-8021-d91f584d35a6","resolution":{"observed_at":"2026-08-03T04:20:56.278664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.348173Z","title":"In- fographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.348173Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:4ebb1a2dd1d6e0f5a4e330c02983e48be13bed97a3ea605bf9d1e5417964f38f","observation_id":"74284f40-3807-4964-9064-ede3c1dffadd","resolution":{"observed_at":"2026-08-03T04:20:56.348173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.454771Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.454771Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:048f54265cb427321b73a7d6488254eec34db4ccc7fee364a3ae701e56d3162f","observation_id":"0468aa6e-2419-4b77-92df-d4c586a2df12","resolution":{"observed_at":"2026-08-03T04:20:56.454771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-08T15:48:31.665148Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-03T04:20:56.545981Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents.arXiv preprint arXiv:2507.04590, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.545981Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:381855dcdcb0719fb924abf45b999b3168df7aa270b29555ad659842a6b35462","observation_id":"5b9ed98a-34ad-43c7-a485-f8ac7fb784f7","resolution":{"observed_at":"2026-08-03T04:20:56.545981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.651977Z","title":"Ops-mm-embedding-v1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.651977Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:493d69181e94cab48cd82f6ab6a0f1df77027c909a79e4fa0152bd959841b187","observation_id":"07739cff-4fdd-40ed-a91e-678f06fad60a","resolution":{"observed_at":"2026-08-03T04:20:56.651977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.773017Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.773017Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:590ed83635bc4891926ee2ad9a7cbe51396555777ce47d131bd14225d5019c62","observation_id":"b96811c7-27b7-4610-86cc-2b0c40849d8a","resolution":{"observed_at":"2026-08-03T04:20:56.773017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.860259Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.860259Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:9ff0bef9558dd9963cb4e63bc03a1a1e31307455dba2892d9ee9a78aaebc6424","observation_id":"c18fb213-721c-4e00-80c4-94d9f798838a","resolution":{"observed_at":"2026-08-03T04:20:56.860259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.955766Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.955766Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:ae89939971dd04c854132e985b67193360aead88a9ee53c1e4b41c04ba470dbf","observation_id":"7d885533-b961-4aff-ac6c-87c1f239c3c9","resolution":{"observed_at":"2026-08-03T04:20:56.955766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.082636Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.082636Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:96246639149c8d25eb0d5d3fe2c5a7fbfd82d63458f5335bfb9ba3eaa3085240","observation_id":"004919ca-0b3c-4749-9a9e-1e8998d48a18","resolution":{"observed_at":"2026-08-03T04:20:57.082636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.170835Z","title":"Sharegpt-chinese-english-90k: A bilingual chinese-english human-machine dialogue dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.170835Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8ba0be6e922d71c9b7e9571030a1a231d57f8b4a46221749d60d0d84dc90cf53","observation_id":"aafa2c93-40bf-4735-a64c-b8f7d18dbf5d","resolution":{"observed_at":"2026-08-03T04:20:57.170835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.249296Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.249296Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:bf76d9226de0be14548621a85d79eeb5202e353014f03b64a74208f1beae3d2d","observation_id":"1e76efb8-36ed-4ea1-93e3-bfc2a5ee58ce","resolution":{"observed_at":"2026-08-03T04:20:57.249296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-08-16T14:20:53.217792Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-03T04:20:57.341823Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters.arXiv:2402.04252, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.341823Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:0b11caa70ca632f24dac2c2829c73af7c00df334950df9e9cbcd63db9be29984","observation_id":"24b1a7b5-fabe-48c9-99c0-5ccc3d4e1fe9","resolution":{"observed_at":"2026-08-03T04:20:57.341823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.407098Z","title":"Breaking the batch barrier (b3) of contrastive learning via smart batch mining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.407098Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:834cc68ebb9b2228eda89120d2a695098c7e15428b2fb5d8fe58698c3b2f1aa1","observation_id":"faabcb24-c86a-452e-a640-9a27f8a5cd1d","resolution":{"observed_at":"2026-08-03T04:20:57.407098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-03T04:20:57.478991Z","title":"Representation learning with contrastive predictive coding.CoRR, abs/1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.478991Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:03ada7bdd0af8cd2e0b77abc94fbe1718821ecc22450dd155eb76d0f7f1b9262","observation_id":"8fe26576-c358-45b5-a0c1-e3d8593f75b0","resolution":{"observed_at":"2026-08-03T04:20:57.478991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.579567Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.579567Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:f0a0abd9ab740e8de741e4613d8a9a0d487332731ac814d11b6519793b84b9d7","observation_id":"596c61a7-975b-44b2-82cc-8b4996b6aef3","resolution":{"observed_at":"2026-08-03T04:20:57.579567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-19T19:09:57.209068Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-03T04:20:57.669229Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.669229Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:37ea5f16cba72b2db5bcf9efcb7bc1f45c45496ce33014b3ec8d8a0694987dd7","observation_id":"260f681b-8edd-4671-8ead-82b65f1cc844","resolution":{"observed_at":"2026-08-03T04:20:57.669229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-08-16T12:55:26.347052Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-03T04:20:57.766049Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents.arXiv preprint arXiv:2502.18017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.766049Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1dac44a14e5a44ae30757e9a6c6a71142f1e83d5ba5cd41e3e5ebffef59517c0","observation_id":"abafe370-d164-4aaa-a5ea-aae9a7ffed09","resolution":{"observed_at":"2026-08-03T04:20:57.766049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.854802Z","title":"N24news: A new dataset for multimodal news classification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.854802Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:b0eb4efa62278521187a3fb136b7dd82d77fc684c70acc929cac60da76104ca4","observation_id":"5b61da42-886d-4981-b2b8-e4323a7d785b","resolution":{"observed_at":"2026-08-03T04:20:57.854802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.950522Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.950522Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:4553b319cbca217f1015614cbc19b552547b921854aa5895d105e0d53f72593c","observation_id":"0fb1d256-49c1-4dae-a81c-7c91b7fb32d9","resolution":{"observed_at":"2026-08-03T04:20:57.950522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.024964Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.024964Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:7df3290705b7779d61c854ae44873239a0e96003f2503b99580a4791165b8064","observation_id":"25b135c0-e703-4dfe-ae65-1a345f848257","resolution":{"observed_at":"2026-08-03T04:20:58.024964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.105500Z","title":"Sun database: Large- scale scene recognition from abbey to zoo","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.105500Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8e2f4a57b1df0cb2c890a25b37b5eb955f46c62e03d50b51a4cd9cae65893b5e","observation_id":"95610b8e-fecd-4fb0-88d1-7d010b0017b9","resolution":{"observed_at":"2026-08-03T04:20:58.105500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-08-03T04:20:58.191649Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient amplifying.arXiv preprint arXiv:2506.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.191649Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:097745942345693f8d921be8216599b49517bf13de38b4d109dd79c0c58f21e3","observation_id":"e645e263-3f3f-4f85-b91b-a49573b0af2c","resolution":{"observed_at":"2026-08-03T04:20:58.191649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.293990Z","title":"Topv: Compatible token pruning with inference time optimization for fast and low-memory multimodal vision language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.293990Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:bcb9c244e6a9a2283f5d7de3ff376de2264bc247f137bad60dfd76ccc4cf05e7","observation_id":"63a04c57-ea50-4ac5-8c7b-f62b7f439f89","resolution":{"observed_at":"2026-08-03T04:20:58.293990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.375026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.375026Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1e18d11112cb0506e15422c4266b4f61df25b61732409ff28bd48b710716033d","observation_id":"0ab8ebf9-b810-4d6a-8d88-74517a54428a","resolution":{"observed_at":"2026-08-03T04:20:58.375026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.475413Z","title":"Visrag: Vision-based retrieval-augmented generation on multi- modality documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.475413Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:bf69fa1b1e4e448c3b12b5b321d7f419c1dbf80320d13799308558bc78f44060","observation_id":"8455edb3-1e95-443d-b124-2f249ab84a32","resolution":{"observed_at":"2026-08-03T04:20:58.475413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00849","last_updated":"2024-03-08T06:42:37Z","snapshot_observed_at":"2026-08-16T14:38:30.459732Z","submitted_at":"2023-12-01T11:36:08Z","title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00849","snapshot_observed_at":"2026-08-03T04:20:58.564725Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback.arXiv preprint arXiv:2312.00849, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.564725Z"},"links":{"cited_paper":"/paper/2312.00849","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:9b0b3285414186c168a13306fe8908d1c0bb018b7f311065ccf6d9b0cb87507d","observation_id":"57d57324-eb6c-4f45-af97-3a5a3dadc5b7","resolution":{"observed_at":"2026-08-03T04:20:58.564725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.673363Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.673363Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:de50194c7655679bf5e41ca78d1670cdeb1201613ff98f427c4517817474c880","observation_id":"1209586c-cb5d-475d-a83e-68d6e4e3ea33","resolution":{"observed_at":"2026-08-03T04:20:58.673363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-20T00:46:15.165076Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-03T04:20:58.781116Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.781116Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:ad0e6d0c790e65c3640e87aaed510fe60cd4ad4a350f2c9bebaad0ff7c7503da","observation_id":"ba776f33-078c-43d5-a1df-22b946cefd29","resolution":{"observed_at":"2026-08-03T04:20:58.781116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.884879Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.884879Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:581666035227aff72789463cfb6d4fa47d5a7bdfb019461ae25b0da462fb2490","observation_id":"96607e15-d8cb-43f3-a865-9623378023ab","resolution":{"observed_at":"2026-08-03T04:20:58.884879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.969922Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.969922Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:614cbfbf238044408ee25796911bbf9f8cc479d84c9354a8bf18dd71b8da7133","observation_id":"3b079c7f-896a-4618-9d41-70ade8542c72","resolution":{"observed_at":"2026-08-03T04:20:58.969922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.051193Z","title":"Notellm-2: Multimodal large representation models for recommendation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.051193Z"},"links":{"citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:71ad00931c6def87c9caedb49c369335775e90767d0bd64e97aeb341d89a5462","observation_id":"54fab929-540e-4984-9a36-29b9b97611d0","resolution":{"observed_at":"2026-08-03T04:20:59.051193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-18T13:43:51.783429Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-08-03T04:20:59.152618Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions.arXiv:2403.19651, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.152618Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:28467ca80431c45368f06a3279c0affd08d2d3b39193fc0596f675f9876b8c87","observation_id":"64dd915b-aee1-431a-aa44-09440a33f759","resolution":{"observed_at":"2026-08-03T04:20:59.152618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-08-16T12:59:28.744276Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-03T04:20:59.229137Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.229137Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:1ca02fa98d2b345f4dc3403d92782b17166d16fc64e8c5ea3df27953957135f8","observation_id":"ba33d555-e37f-4f04-b8c6-f4f9b1180065","resolution":{"observed_at":"2026-08-03T04:20:59.229137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 0 inbound Pith citation observations for arXiv:2602.05275."}