{"as_of":"2026-08-09T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5a205d773cb1562ddaa48eab47c0385c4f99baf2a6da2e5b22c4ba17c533ce0","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:43:17.507439Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01794/citation-record","integrity":"/paper/2608.01794/integrity","json":"/paper/2608.01794/citation-record.json","paper":"/paper/2608.01794"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-04T20:43:13.346553Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.346553Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:da6b5c1610d00dc8f22611402d9e83cc0b6a375be08eccb9742b8c72d2b389b1","observation_id":"2363b7d3-81bd-4afc-a3da-8fe99693d3db","resolution":{"observed_at":"2026-08-04T20:43:13.346553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05884","last_updated":"2023-04-12T14:25:52Z","snapshot_observed_at":"2026-07-06T15:14:51.848836Z","submitted_at":"2023-04-12T14:25:52Z","title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05884","snapshot_observed_at":"2026-08-04T20:43:13.403233Z","title":"Unicom: Universal and compact representation learning for image re- trieval.arXiv preprint arXiv:2304.05884, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.403233Z"},"links":{"cited_paper":"/paper/2304.05884","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:093a99a0cf3f79ba2ee93de8622e6ea86a418aff57acbc5de75bdb3423f7d832","observation_id":"bd4f6e0e-b313-4b2c-89cf-b70b0de3e3dc","resolution":{"observed_at":"2026-08-04T20:43:13.403233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T20:43:13.493030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.493030Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:98b216c12b65c9401e3af19cafd0f211e1ab27eb1a4929c1d6a48ed506610bd0","observation_id":"88636538-b85b-48d0-8d11-55c14ce56b5b","resolution":{"observed_at":"2026-08-04T20:43:13.493030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-08T03:53:14.177644Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-04T20:43:13.611224Z","title":"Llm2vec: Large language models are secretly pow- erful text encoders.arXiv preprint arXiv:2404.05961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.611224Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:728c97e742c56a4023d5cede63824eeae96c7f49d89a815549e28f9eb77ab635","observation_id":"6dd964af-ecc0-4d72-b6a0-0b501e81ebdb","resolution":{"observed_at":"2026-08-04T20:43:13.611224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:13.727986Z","title":"Flame: Frozen large language models enable data-efficient language-image pre- training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.727986Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:6ce72fb8ccfa44654b21781b7b94f7e224098e7ee57e55218e2f02ec89d89e97","observation_id":"a64de592-e3dc-479b-8d0b-49625f0cf298","resolution":{"observed_at":"2026-08-04T20:43:13.727986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-09T01:49:29.596087Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-04T20:43:13.812234Z","title":"mme5: Improving mul- timodal multilingual embeddings via high-quality synthetic data.arXiv preprint arXiv:2502.08468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.812234Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:60dd3565ac5b8aae0f1b55bb64ef1260f719a677d0c4ce30e53384be779769de","observation_id":"9e7d481e-e174-4d49-a57f-18746709650d","resolution":{"observed_at":"2026-08-04T20:43:13.812234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:13.932581Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:13.932581Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:ff626aee0247b50317d83e3ec9bc9c501bd34f5ca35873576f94a0bb2a3fc8bf","observation_id":"ce543fff-5dde-46e1-bc81-2031f0eb2874","resolution":{"observed_at":"2026-08-04T20:43:13.932581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:14.058096Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.058096Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:988096a6a713f31624d43c259f7694adef5c498165b60f7e845583b3eef6c20e","observation_id":"c0ab3143-6da5-4689-99ea-34a6d71ff4a8","resolution":{"observed_at":"2026-08-04T20:43:14.058096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:14.225875Z","title":"Opengpt-4o-image: A com- prehensive dataset for advanced image generation and edit- ing.arXiv preprint arXiv:2509.24900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.225875Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:cc712f0b07c1b1453a6a114352432977b7d7e2132d5d6ee628ba6065879d24ea","observation_id":"e2d25ea6-cd73-4d60-9e7a-3ef01090b387","resolution":{"observed_at":"2026-08-04T20:43:14.225875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:14.394360Z","title":"Think then embed: Generative context improves multimodal embedding.arXiv preprint arXiv:2510.05014,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.394360Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:99b829d72fc2e82d4bd451b9238564f85849f6826311c6f48238108067b1a5c6","observation_id":"ced016ae-bb8a-4efa-8861-ef6d4e4a0e19","resolution":{"observed_at":"2026-08-04T20:43:14.394360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:14.494829Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.494829Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:6a192184d74f7d63acf13e548b137a7489d3c5ee24291cf56f857af2175085c3","observation_id":"1503431a-f199-4920-89fd-2aa1bdbb0418","resolution":{"observed_at":"2026-08-04T20:43:14.494829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:14.665447Z","title":"Efficient and discriminative image feature extrac- tion for universal image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.665447Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:8924f3541dca87f73c47868e690059f891e4f58575fe7157066e9f067a359e9a","observation_id":"84c5eb15-19db-4409-9a10-8ec3f53b88d7","resolution":{"observed_at":"2026-08-04T20:43:14.665447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-04T20:43:14.825424Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data.arXiv preprint arXiv:2306.09344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.825424Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:060131b73e0358904d5bcd9181f19b6b9a4ee5032a424222e5fe8250e11634cb","observation_id":"6675d07d-4f80-441a-9de8-552a76f22541","resolution":{"observed_at":"2026-08-04T20:43:14.825424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06983","last_updated":"2021-06-14T16:37:28Z","snapshot_observed_at":"2026-08-05T13:29:43.119220Z","submitted_at":"2021-01-18T10:42:34Z","title":"Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06983","snapshot_observed_at":"2026-08-04T20:43:14.991222Z","title":"Scaling deep contrastive learning batch size under memory limited setup.arXiv preprint arXiv:2101.06983, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:14.991222Z"},"links":{"cited_paper":"/paper/2101.06983","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:344c0411d17bad7f448479ab12e951a2b39d297240723fe0641fba6b71dc854b","observation_id":"3e1ac40a-362b-4648-b680-886b4dcee7b4","resolution":{"observed_at":"2026-08-04T20:43:14.991222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-04T20:43:15.155373Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.155373Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:ba9d644cb1dce26e497ea3f806485725cdfc290e8ce9b03e092a78c6226c9c1f","observation_id":"036f4965-2c3d-44eb-95c6-f35eb5cbe0a1","resolution":{"observed_at":"2026-08-04T20:43:15.155373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.239595Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms.arXiv preprint arXiv:2504.17432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.239595Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:28fddac6b36ac6bff707e3c808193d1353fccb0f228e3422bd61ce992187eb06","observation_id":"a2d55248-5423-4de2-bd52-c4b22dd1ce2b","resolution":{"observed_at":"2026-08-04T20:43:15.239595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.281060Z","title":"Unime-v2: Mllm-as-a-judge for uni- versal multimodal embedding learning.arXiv preprint arXiv:2510.13515, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.281060Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:aabb7cec3c08f0db174dc38e56cb7ab7d8883901b365ddcd3e872a496df88cb4","observation_id":"809043bb-8bd1-4a11-8630-d35cce3060a4","resolution":{"observed_at":"2026-08-04T20:43:15.281060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.356047Z","title":"jina-embeddings-v4: Universal embeddings for multimodal multilingual retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.356047Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:125cf18a28df7801df5f71371386e870564fe0077ec13a7540b662fc3587cded","observation_id":"c6a7724b-16fd-42e0-8e92-c11485f0cb06","resolution":{"observed_at":"2026-08-04T20:43:15.356047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.495874Z","title":"Ms-celeb-1m: A dataset and benchmark for large-scale face recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.495874Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:089a9ed801643d61baaa744ad90a0c123efdf1c0b411c659b73b26e0bc45d4d8","observation_id":"44a9300e-5520-4cee-ae65-51ce664fb9c2","resolution":{"observed_at":"2026-08-04T20:43:15.495874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-04T09:19:45.912586Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-04T20:43:15.565316Z","title":"In de- fense of the triplet loss for person re-identification.arXiv preprint arXiv:1703.07737, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.565316Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:1905e89cc803c39b16fd898dc43e3f636f8f26502f60c2fafd680843731faed8","observation_id":"f71a18a8-5f8a-4d10-ae47-c58f4fb9ad44","resolution":{"observed_at":"2026-08-04T20:43:15.565316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.678112Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.678112Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:8e5a17bd1511a8d86b630096f43079d42cc3a6c7de020b8e1624ac39bd8af491","observation_id":"07e17851-bee6-46b0-aa54-affa8b247483","resolution":{"observed_at":"2026-08-04T20:43:15.678112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.751502Z","title":"Llm2clip: Powerful language model unlocks richer visual representation.arXiv preprint arXiv:2411.04997, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.751502Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:571ac676588471e28cbc33d458936d1293c0bb620c27c4187da157ea032c07bf","observation_id":"31614ed6-7a1a-41c3-bc9d-bc694a947a15","resolution":{"observed_at":"2026-08-04T20:43:15.751502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:15.861413Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.861413Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:f143fbb1ded97a0ad1abdf56e377fce40ed166ea3377a29b9210c65bf2be55b7","observation_id":"7e5169f5-85b8-4aad-a134-ca2008b0f153","resolution":{"observed_at":"2026-08-04T20:43:15.861413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-04T20:43:15.906861Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:15.906861Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:1ef826abd29c81b6ecc7e80c7f9842c4ff6666b0d2f3281b30cb445291f0bef9","observation_id":"aec1c32d-63af-40d8-a722-e6794830ce73","resolution":{"observed_at":"2026-08-04T20:43:15.906861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:22.473312Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"c9327876-de9a-4fff-93f5-714da7df1c90","year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.006633Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:9e00b70fbd446ac22a2cdad62efdaca48b34efb80bd627dbdc98b8459e0a3ec2","observation_id":"8c618cf0-6d98-493e-af7c-dc803f18a35b","resolution":{"observed_at":"2026-08-04T20:43:22.560698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T20:43:16.106644Z","title":"Modality curation: Building uni- versal embeddings for advanced multimodal information re- trieval.arXiv preprint arXiv:2505.19650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.106644Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:1f9884103c15128e63183f882302f1a72e94f532f1448bab9beb5e5385bd7d84","observation_id":"68e4c1a0-4d0d-436a-b85c-8bffd421c7ac","resolution":{"observed_at":"2026-08-04T20:43:16.106644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:22.249200Z","title":"Ilias: Instance-level image retrieval at scale","venue":null,"work_id":"d65c7a55-911a-44f5-8112-5e0fc66fd58d","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.217922Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:00aea07235a35c5c90203d1e94789ad512af900d58c809daae6b15b29075e27d","observation_id":"69f665ef-4a45-4d80-a72b-0487e08fa2e7","resolution":{"observed_at":"2026-08-04T20:43:22.326487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08802","last_updated":"2025-04-24T16:22:33Z","snapshot_observed_at":"2026-08-07T19:56:45.144619Z","submitted_at":"2024-12-11T22:28:12Z","title":"jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08802","snapshot_observed_at":"2026-08-04T20:43:16.254863Z","title":"jina- clip-v2: Multilingual multimodal embeddings for text and images.arXiv preprint arXiv:2412.08802, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.254863Z"},"links":{"cited_paper":"/paper/2412.08802","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:327b9325701a2c25374537ee8d0b0bd90eebbeb351a45ca31dcf22c95c86c407","observation_id":"73ae2735-f4c0-4927-ba64-3ea619c019e7","resolution":{"observed_at":"2026-08-04T20:43:16.254863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:22.058738Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"52e48ab9-6c79-4e48-8a18-1039e0ba95c6","year":2013},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.403310Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:8acca06a42e4905086d518e9e9a8f2f8fa54ba2bcf4e1ed4a493e16011502a5c","observation_id":"a65a327a-6dda-4007-b95c-ae815c88f5d0","resolution":{"observed_at":"2026-08-04T20:43:22.112459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:16.514852Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning.arXiv preprint arXiv:2503.04812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.514852Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:f6dfd3bc88a648eee0c324f4122bccd46dd2d07c5f8686ae1b08812bf265e2dd","observation_id":"4d378f39-698e-463e-b460-d32df3b19ecd","resolution":{"observed_at":"2026-08-04T20:43:16.514852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-04T20:43:16.588928Z","title":"Nv- embed: Improved techniques for training llms as generalist embedding models.arXiv preprint arXiv:2405.17428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.588928Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:038965e42f7d146c3b4fb567a75428122ea18b6508326fd909334ac823d6ee70","observation_id":"8fdaf9ed-6939-417d-b030-3aef457a9870","resolution":{"observed_at":"2026-08-04T20:43:16.588928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:43:16.658249Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.658249Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:be4b5a9849d9a985b3b0c5e0fe4e5af7dffaed08b44d55700f2da906c4bfb1e4","observation_id":"c5aa0e80-d869-447d-9cf1-3cc72948598d","resolution":{"observed_at":"2026-08-04T20:43:16.658249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12689","last_updated":"2025-03-16T23:15:09Z","snapshot_observed_at":"2026-08-07T17:00:03.554802Z","submitted_at":"2025-03-16T23:15:09Z","title":"MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization","version":1},"cited_work":{"arxiv_id":"2503.12689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12689","snapshot_observed_at":"2026-08-04T20:43:17.739344Z","title":"MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization","venue":"cs.CV","work_id":"738331a0-0094-4b88-984e-6541e929e35b","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.771390Z"},"links":{"cited_paper":"/paper/2503.12689","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:37a1393c61e3171556da3c525ac09753d62930a1ef77ff8330bdf6074fa20b92","observation_id":"b1c7a46d-5e3a-4422-ba4e-2b86744e564a","resolution":{"observed_at":"2026-08-04T20:43:17.744970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:21.843099Z","title":"Personalvideo: High id-fidelity video customization without dynamic and semantic degradation","venue":null,"work_id":"229a579f-8d07-4356-8232-3a1fe0ceb59f","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.813054Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:dda65f27b46933f98a07157b428c9b330370243e9f1335462fe765125173b32a","observation_id":"6dc4ce12-4e7a-495b-8c25-13ae83d0a9db","resolution":{"observed_at":"2026-08-04T20:43:21.903587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:16.848115Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.848115Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:96b99db4c2b63829e5cf1b450c21b73539d96ebc920036d58c1b745c0a8842de","observation_id":"77dbe72f-dc1e-4ac4-ae64-923d92c34748","resolution":{"observed_at":"2026-08-04T20:43:16.848115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-04T20:43:16.957129Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.957129Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:e388147ed1cc4cd6640a29b85ad1a0914aaecb523e90226c5c93aca2f21cdad9","observation_id":"20c6ace6-e135-4bb5-a263-204f179e002a","resolution":{"observed_at":"2026-08-04T20:43:16.957129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-04T20:43:17.032612Z","title":"Uniworld: High-resolution semantic en- coders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.032612Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:f85806c4528314c4a6e3e2e1e3dc6ae0987468f092e69151dadab2384a972653","observation_id":"f6134962-d0e8-4c11-8465-dabdb4092ea0","resolution":{"observed_at":"2026-08-04T20:43:17.032612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:21.605784Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms","venue":null,"work_id":"2482ab0c-8ce0-4ab6-a28c-01b176e1db47","year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.102764Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:b542eb67c3bf58ace13d40f93f5eb20330406dd270ed2cb673916e66b53e2fdd","observation_id":"55759e70-7d51-48d1-ae24-01e839854cf1","resolution":{"observed_at":"2026-08-04T20:43:21.674734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00954","last_updated":"2025-04-01T16:47:20Z","snapshot_observed_at":"2026-08-07T16:16:57.345878Z","submitted_at":"2025-04-01T16:47:20Z","title":"IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00954","snapshot_observed_at":"2026-08-04T20:43:17.179548Z","title":"Idmr: Towards instance-driven precise visual cor- respondence in multimodal retrieval.arXiv preprint arXiv:2504.00954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.179548Z"},"links":{"cited_paper":"/paper/2504.00954","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:30e0ed0c6d173232e1df4842fb65319321d9513a69c06f3f4b4a49001d0744ae","observation_id":"97524d2e-81b4-4eaf-b53f-630d677d6522","resolution":{"observed_at":"2026-08-04T20:43:17.179548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:21.403342Z","title":"Automatic synthetic data and fine- grained adaptive feature alignment for composed person re- trieval","venue":null,"work_id":"e49f0910-9c37-4a43-aadb-2cf565adb301","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.257562Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:4c38b2f9529d055ae0913543c7f049089b450667f97cb198d32c2d2711214da4","observation_id":"2c0a19dd-6584-43e3-8e78-f2306bde46d5","resolution":{"observed_at":"2026-08-04T20:43:21.464572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.260553Z","title":"Sphereface: Deep hypersphere embedding for face recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.260553Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:327673f810730ff950e5d393dbbd381e86e78b32611e2d03afc9e8b55aa0de78","observation_id":"9f181751-f6ec-46ee-8eeb-b9440fc26489","resolution":{"observed_at":"2026-08-04T20:43:17.260553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:21.197419Z","title":"Large- scale vehicle re-identification in urban surveillance videos","venue":null,"work_id":"3d7ec23b-1199-41a9-9fe4-e58c3b5836c6","year":2016},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.264145Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:400b3e7df8b6d8f3d447f2a3b14dc19793288935536f726d46a7e7b41760a19b","observation_id":"775382e5-b8cc-4a14-a21b-127769462100","resolution":{"observed_at":"2026-08-04T20:43:21.260878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.922569Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant","venue":null,"work_id":"894e4823-d651-4f6d-a86d-bde4991f015c","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.267112Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:eaf33841d744c2901b2abb7c630b78fc949df6d6ac38d7ceac9adce184287c7c","observation_id":"bcfdc93d-0712-4382-8ac6-8d4129837f68","resolution":{"observed_at":"2026-08-04T20:43:21.013085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.739756Z","title":"Deepfashion: Powering robust clothes recognition and retrieval with rich annotations","venue":null,"work_id":"b4a68bd6-02ac-451e-af6f-620a8c5df17d","year":2016},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.270047Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:2548a3fc42694c32912d15957d30ac93506a750cc28ae9d40304ebb1e23b55eb","observation_id":"45cf1584-619d-4bbf-bf45-0b149e00568f","resolution":{"observed_at":"2026-08-04T20:43:20.814995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-08T15:48:31.665148Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-04T20:43:17.273022Z","title":"Vlm2vec-v2: Advancing multimodal em- bedding for videos, images, and visual documents.arXiv preprint arXiv:2507.04590, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.273022Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:135bf32f38103964e487f0aaa60cf691eb6adc3a67b44362d56eccbf0c79e723","observation_id":"8091a9df-dbd6-42d8-81e4-7712ab156d92","resolution":{"observed_at":"2026-08-04T20:43:17.273022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.569189Z","title":"A culturally-aware benchmark for person re-identification in modest attire.Engineering Ap- plications of Artificial Intelligence, 158:111494, 2025","venue":null,"work_id":"164b4f2a-85db-4779-9877-2b2eebef4791","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.276038Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:6fdf37f4574ae3aec7688a2921c4a63cba01daaaa832a1851317ee7b590a1e61","observation_id":"d6eef85d-e283-41e8-8d54-c2db472faef7","resolution":{"observed_at":"2026-08-04T20:43:20.638218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.338962Z","title":"Deep metric learning via lifted structured fea- ture embedding","venue":null,"work_id":"7aca77d4-43cc-474c-9c8d-a2573d01e112","year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.281806Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:98e59779c877ef84d37c1a17756d3850fdf5a08fcf8747b9839f9909d5c6dd08","observation_id":"421feeaf-c31b-42ed-a906-f54525ffb7e8","resolution":{"observed_at":"2026-08-04T20:43:20.392243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12634","last_updated":"2021-09-01T16:21:13Z","snapshot_observed_at":"2026-08-07T10:00:45.682572Z","submitted_at":"2020-06-22T21:39:56Z","title":"RP2K: A Large-Scale Retail Product Dataset for Fine-Grained Image Classification","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12634","snapshot_observed_at":"2026-08-04T20:43:17.284647Z","title":"Rp2k: A large- scale retail product dataset for fine-grained image classifica- tion.arXiv preprint arXiv:2006.12634, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.284647Z"},"links":{"cited_paper":"/paper/2006.12634","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:9d3dd3b21b4d7b6c3c325d9ef8e6345fb4c8558f22f1c7cbce5399dc07994b9e","observation_id":"5898f116-c7ce-4c52-b079-08ad080bd6a7","resolution":{"observed_at":"2026-08-04T20:43:17.284647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.187125Z","title":"Revisiting oxford and paris: Large-scale image retrieval benchmarking","venue":null,"work_id":"d9ad4665-2d33-4786-afa1-8e12f8b482fc","year":2018},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.288092Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:112f1868f6e6172422c38ab41f7e7e0caeb18f626a2d230da664355a19780448","observation_id":"4eaf0447-583f-46d7-8672-60cb21b66218","resolution":{"observed_at":"2026-08-04T20:43:20.266199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.290997Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.290997Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:34f0f73207f53b1fa1ad83125eaf5c805b04215f5d4f4681b7b919d07295712d","observation_id":"624f29d7-4559-42a1-9e5c-1285ade0939e","resolution":{"observed_at":"2026-08-04T20:43:17.290997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:20.030255Z","title":"Performance measures and a data set for multi-target, multi-camera tracking","venue":null,"work_id":"b442dcec-1ffa-4cba-af65-7af17d2609ce","year":2016},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.293921Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:fa23931f1f80fdd6a7d005740de78fcb0404fe053eb223eb035b57df8280f12d","observation_id":"e24db9c0-0477-404c-b96c-4fa04bdd4ca2","resolution":{"observed_at":"2026-08-04T20:43:20.078583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T20:43:17.297183Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.297183Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:3d3920646e1adc9401dd0971aeda2c3b9659cdfb011e6ad8d6124673d6595c90","observation_id":"3aa65bd2-642e-44e9-9f56-f9c3284cf5c8","resolution":{"observed_at":"2026-08-04T20:43:17.297183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.890102Z","title":"Visual named entity linking: A new dataset and a baseline","venue":null,"work_id":"561870f3-0480-4b96-b83a-d227b96d213d","year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.300330Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:20b098a90a21e845e6c35841f3d7316742ad352625bb4cb66e33d3cc3896734a","observation_id":"51c43246-bcb5-42d8-85e2-138c2169789b","resolution":{"observed_at":"2026-08-04T20:43:19.950019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.303217Z","title":"Breaking the batch barrier (b3) of contrastive learning via smart batch mining.arXiv preprint arXiv:2505.11293, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.303217Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:55cdb99f67d2690950f69d3dfb2c3ef8d3ca51783c87de28088e7e47252df33e","observation_id":"9297161b-4cfe-43c4-8db0-90ab72749cd6","resolution":{"observed_at":"2026-08-04T20:43:17.303217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T20:43:17.306059Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.306059Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:89e6048f6e90709c45cae8cb97fb3f0e726ef7a0bf1d2077619a6e95685be131","observation_id":"7b175f18-ce65-49f6-b80d-f97439b0ad29","resolution":{"observed_at":"2026-08-04T20:43:17.306059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.309133Z","title":"The inaturalist species classification and de- tection dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.309133Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:4dd2934184a26df151639b15433c3266bb8057433be4d111453ce777dc38f69b","observation_id":"610fae48-b01c-4259-8dc5-e769b16bfb37","resolution":{"observed_at":"2026-08-04T20:43:17.309133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T20:43:17.312239Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.312239Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:eeb78d5ae134c40c437ea05940bb7da217bf4633d50aba539e530648ccdc633f","observation_id":"f4055274-555e-4706-a121-2c528e67943e","resolution":{"observed_at":"2026-08-04T20:43:17.312239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-04T20:43:17.315397Z","title":"Instantid: Zero-shot identity-preserving generation in seconds.arXiv preprint arXiv:2401.07519, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.315397Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:92ac38d351b5bc89d30b5b2e5916ee0f7bcd914e0543dd1f0481bf1d785cd695","observation_id":"60351181-dd15-4ad5-9198-04f7cc56be39","resolution":{"observed_at":"2026-08-04T20:43:17.315397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-08T13:17:53.714491Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-04T20:43:17.318655Z","title":"Gpt-image-edit- 1.5 m: A million-scale, gpt-generated image dataset.arXiv preprint arXiv:2507.21033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.318655Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:437567545efd34233e1ecab7563fb65526f6fd41f0f32a8ddbd2bcda7be30eef","observation_id":"e875a0a6-b8b5-442d-8947-11f2f9821327","resolution":{"observed_at":"2026-08-04T20:43:17.318655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.732481Z","title":"Uniir: Train- ing and benchmarking universal multimodal information re- trievers","venue":null,"work_id":"696c11cd-7fab-4b58-a750-b97c30ec9137","year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.322048Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:158b790498b9875b168d463b511c85429d33c3d6f39d0792e1ec8f28ccb09a19","observation_id":"932e528f-e291-479a-afd3-bda7ba484c26","resolution":{"observed_at":"2026-08-04T20:43:19.787105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.564512Z","title":"Google landmarks dataset v2-a large-scale benchmark for instance-level recognition and retrieval","venue":null,"work_id":"7e12b7c8-e432-402b-8f7c-e2baaf067a62","year":2020},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.324853Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:ea6535c6c124fadbc1788b06dfe3a594ea9a6d1df4ec403cf96422d05312f975","observation_id":"6755346c-bcb1-4235-8fe7-e6c08722c841","resolution":{"observed_at":"2026-08-04T20:43:19.613019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.438090Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"6e8ca86e-0f0b-47c7-b716-d9df2efd0e31","year":2021},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.327787Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:043146cc77ffd7c8504644bc2c60d1925163dfc2b6cd039c08790f891e4c0743","observation_id":"99e89c04-a22a-4938-bea5-2df5c91abf9e","resolution":{"observed_at":"2026-08-04T20:43:19.467311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.312942Z","title":"Forb: a flat object retrieval benchmark for universal im- age embedding.Advances in Neural Information Processing Systems, 36:25448–25460, 2023","venue":null,"work_id":"c71c92ca-5c61-4324-9a61-97102361bcf8","year":2023},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.330652Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:eb59a0133c6b22a98440049251a874021d6c2424c5f01e1d775248ebe7c30406","observation_id":"d03ce222-b0c5-458c-aa79-c6143ef507e5","resolution":{"observed_at":"2026-08-04T20:43:19.366074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.333489Z","title":"Withanyone: Towards control- lable and id consistent image generation.arXiv preprint arXiv:2510.14975, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.333489Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:5eb327fa2834373e46e3af99f6128ec04796873e8c90d55713e9d66bacdf3ede","observation_id":"46449807-f27c-469a-8b8c-f762153cc6e0","resolution":{"observed_at":"2026-08-04T20:43:17.333489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-07T13:09:47.854060Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02020","snapshot_observed_at":"2026-08-04T20:43:17.336608Z","title":"Improve multi-modal embedding learning via explicit hard negative gradient am- plifying.arXiv preprint arXiv:2506.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.336608Z"},"links":{"cited_paper":"/paper/2506.02020","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:13356f1effa91f0bd6087daf8f986dce67aae6970943b23d88c986137f17b70d","observation_id":"d2e52caf-a117-4d20-864f-ee1847e6c1db","resolution":{"observed_at":"2026-08-04T20:43:17.336608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-02T21:42:25.156081Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-04T20:43:17.339889Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.339889Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:8e7e17ba33a0989293367fdcfc1c45c527efe1108938b3d5609289d941b1f667","observation_id":"87e9efb2-e9f0-4622-8961-558d1fdb1567","resolution":{"observed_at":"2026-08-04T20:43:17.339889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.167361Z","title":"A large-scale car dataset for fine-grained categorization and verification","venue":null,"work_id":"32453bb5-7d8b-46ba-ba9a-e854affb4d33","year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.342861Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:fb23f3108e57b6508d4bdfeb228439a64e584f4abab3daee5516172f2dbf19c7","observation_id":"7af4341d-dbac-4eda-b7b4-20a07289fc47","resolution":{"observed_at":"2026-08-04T20:43:19.229304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:19.042918Z","title":"Deep learning for person re- identification: A survey and outlook.IEEE transactions on pattern analysis and machine intelligence, 44(6):2872–2893,","venue":null,"work_id":"5d8e79bd-1a53-45c1-9340-e23dedf3f47a","year":null},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.345722Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:7981f324557066b5e140cd266ef3d066a067d32e18bf6c5b3a046e2e25b6c74a","observation_id":"e90943c0-354b-48fb-82e6-fcba2ef6a499","resolution":{"observed_at":"2026-08-04T20:43:19.085925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.7923","last_updated":"2014-11-28T16:05:18Z","snapshot_observed_at":"2026-07-06T04:02:01.303133Z","submitted_at":"2014-11-28T16:05:18Z","title":"Learning Face Representation from Scratch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.7923","snapshot_observed_at":"2026-08-04T20:43:17.348652Z","title":"Learn- ing face representation from scratch.arXiv preprint arXiv:1411.7923, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.348652Z"},"links":{"cited_paper":"/paper/1411.7923","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:911a174b30cab632b1368014a3ee0e7c7817d9e1ae413f829a4eda92e358d0fb","observation_id":"7cd99d99-95d9-4e89-a6ef-3f036daaf510","resolution":{"observed_at":"2026-08-04T20:43:17.348652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.886054Z","title":"The met dataset: Instance-level recognition for artworks","venue":null,"work_id":"103b8d23-2620-4c6c-9052-a182e9072be6","year":2021},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.351877Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:3d90074b3b1d717b41fa1f10763010ab86489b0952b9f567581b079fd97670e0","observation_id":"ac953921-ea05-4cee-a1ac-eed9274e9d03","resolution":{"observed_at":"2026-08-04T20:43:18.941829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.771301Z","title":"Towards universal image embed- dings: A large-scale dataset and challenge for generic image representations","venue":null,"work_id":"f8996750-55bf-4603-a90e-98a66a098ab8","year":2023},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.354680Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:ae2d1041e0b7b200aa5952b15f255c6bc887b9d893ac694f8cd9403958d47cb1","observation_id":"2bd6fb3a-74be-4cc9-a278-c3e40dd7f15b","resolution":{"observed_at":"2026-08-04T20:43:18.824469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.641546Z","title":"Udon: Universal dynamic online distilla- tion for generic image representations.Advances in Neural Information Processing Systems, 37:86836–86859, 2024","venue":null,"work_id":"b9a5afb8-e912-4431-9b87-c758ac6d04c8","year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.357587Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:2b956d9337d350e8ba4bf4db4dacbc32f685651a8b940ff50277c317a787901a","observation_id":"9cbd0a3e-e878-45fd-857a-ffbc63cac070","resolution":{"observed_at":"2026-08-04T20:43:18.694822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-04T20:43:17.360998Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.360998Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:2c7536075827aa1bdb3cf7560641213f417e052c3ec9ea9171dd13242e9c9fc9","observation_id":"931fdf07-6b8d-4b55-98f8-1f24ea3029e9","resolution":{"observed_at":"2026-08-04T20:43:17.360998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-04T20:43:17.364610Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents.arXiv preprint arXiv:2410.10594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.364610Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:80cea5e9b9b92240e6fb11d92ba06f6bfca28a2da3d2fa65044d0473d9017c0b","observation_id":"8178b8ee-26cc-4913-9162-c5f2d8ad71e5","resolution":{"observed_at":"2026-08-04T20:43:17.364610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.514029Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"6a9ee144-7da1-4efd-841f-0ed0a6a47a1a","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.367779Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:490d7b1357ba6f3ae0e392eeea625a17f5c10bc8762a48aab585a004a5e001e5","observation_id":"6c629151-d8cf-4adc-8784-379eba4fed65","resolution":{"observed_at":"2026-08-04T20:43:18.558554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.370533Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.370533Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:5d3056074211a8a4f32b154cc8f8982930d44e3293444dbdfff91781f196f7c3","observation_id":"40690f5a-428d-4b23-8919-477e13ee1eb5","resolution":{"observed_at":"2026-08-04T20:43:17.370533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.377734Z","title":"Prod- uct1m: Towards weakly supervised instance-level product retrieval via cross-modal pretraining","venue":null,"work_id":"ce111692-04fd-4881-9ee7-23a8011b1aae","year":2021},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.373366Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:1db7b76d2879451fd963926d9082f58a40f171bc34fd1cbb504a3444795cd99a","observation_id":"b18f833e-7fe4-4b36-9661-ab9b29429545","resolution":{"observed_at":"2026-08-04T20:43:18.413590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-08-04T20:43:17.376305Z","title":"Magi- clens: Self-supervised image retrieval with open-ended in- structions.arXiv preprint arXiv:2403.19651, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.376305Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:44b55d5be5f0dde31e90e81c3b4564f17a5ce40b49b875a1133db0243cd223ee","observation_id":"5fd02a67-b5ed-461a-99b7-0bc1bf3d7fdd","resolution":{"observed_at":"2026-08-04T20:43:17.376305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.379454Z","title":"Assess- ing and learning alignment of unimodal vision and language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.379454Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:c1cc50d608bd38ef6ed1b46a6fe88f5f307c8f12c2734fdf438ec348438fa284","observation_id":"9fd7f93b-194a-406e-b802-404beba054a2","resolution":{"observed_at":"2026-08-04T20:43:17.379454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.231404Z","title":"Beyond frontal faces: Improving per- son recognition using multiple cues","venue":null,"work_id":"809cc231-4b27-433c-8086-3654e4a9fddb","year":2015},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.382385Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:b7131e442be21dc1c648e5eded4541bd4c7c68ce66cc39119430a632dffbced4","observation_id":"1dde37f5-d3b3-4440-9a43-fc552cb4ac59","resolution":{"observed_at":"2026-08-04T20:43:18.275526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-04T20:43:17.485401Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms.arXiv preprint arXiv:2412.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.485401Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:9ec9cd281e54894143ff4332339590e983da8b0d48049314d093fbc4da78f606","observation_id":"a68bac3d-d1c0-410e-b9bb-f932ca113872","resolution":{"observed_at":"2026-08-04T20:43:17.485401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-04T20:43:17.489048Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.489048Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:ec2c66ca37c751b28b215dc3daf9dec7861031525eb48d763f9646c91ab84a3a","observation_id":"1ea36a60-e6aa-4864-a5f7-160629ce6583","resolution":{"observed_at":"2026-08-04T20:43:17.489048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.064467Z","title":"Magicmirror: Id-preserved video generation in video diffusion transformers","venue":null,"work_id":"295dc751-eff0-42a9-b7ce-17af88e5dd6b","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.492298Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:fd7ba4baa2d3308a282e63ee771689a2eaa7943a970688ccb60ff64038f6feff","observation_id":"e18f69cb-8fdc-4673-917f-1354f340451b","resolution":{"observed_at":"2026-08-04T20:43:18.119414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.026977Z","title":"Scalable person re-identification: A benchmark","venue":null,"work_id":"c31a6ba8-d3d4-419a-bf87-34f7bb689f51","year":2015},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.495323Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:b1b6aa5fe865b27d73d6f900c1c957d3b090eac79e24fb6313289917f585fa22","observation_id":"0d85fe8b-7bc2-406a-87ae-95816f61eebe","resolution":{"observed_at":"2026-08-04T20:43:18.035923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:18.001646Z","title":"Scalable person re-identification: A benchmark","venue":null,"work_id":"855b8619-4596-45d3-9942-b756b513f1a5","year":2015},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.498322Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:f6ada5668b2c3fcf6960ad8f5ba8b0ab91c8df719473e502d2cd7eb7e96097db","observation_id":"da79ef23-b212-4b4f-999e-de3b37100501","resolution":{"observed_at":"2026-08-04T20:43:18.010772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.974283Z","title":"Cartoon face recognition: A bench- mark dataset","venue":null,"work_id":"b5280d07-e5cc-46b0-8896-78afeae8581f","year":2020},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.501286Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:3be13da48c7f6ad6f619dd526ff165aae861f9ba5332ee4c4c23b67f8bf1f829","observation_id":"10ef6a1b-c816-419f-b476-c14682660d44","resolution":{"observed_at":"2026-08-04T20:43:17.983167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:43:17.955416Z","title":"Megapairs: Massive data synthesis for universal multi- modal retrieval","venue":null,"work_id":"a31d3f2a-ddfa-4b15-b7c2-7f5ed417ee15","year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.504442Z"},"links":{"citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:3e8c55efdd9b86135fff8d6223ac8ea4f5b442fd347d0676e6093dfd072eb92b","observation_id":"47e166c9-8827-4454-9a0a-97499ad8221c","resolution":{"observed_at":"2026-08-04T20:43:17.963805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T20:43:17.507439Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.507439Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:c6cc67b66dd333f6366211e44f0a85376eef2169e88186dbee4d37af824e015b","observation_id":"7f78a490-0d0c-41d6-bd8c-2321a9113e37","resolution":{"observed_at":"2026-08-04T20:43:17.507439Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:15:22.184992Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2608.01794."}