{"as_of":"2026-08-08T20:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6c842d56dbf7f3135eb0def0f4bdb93495fa43d867b231f87b217aafb0990e7","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:52:26.368534Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:30:14.527131Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:26:45.637665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:20b3503f3b3b3f981590ddbe284f5415ccf98473aad77187379a075cbbd32728","observation_id":"4040c3b5-7f43-4da2-b596-f0cd0b882796","resolution":{"observed_at":"2026-05-18T14:11:27.483851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-08-03T01:02:32.688658Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-08T07:23:55.696942Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.688658Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:b1202e102014e6c8de3c831365bb1e2e30b6eee9fd138877f14f65a96d9c8419","observation_id":"12d175b6-6b6f-42b9-9584-86eab0bb3b58","resolution":{"observed_at":"2026-08-03T01:02:32.688658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-08-02T19:41:31.172392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:31.172392Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:e0cf3b5e140d302a09c42c2b6b2701ed2c25e9b953630584c457d16b556468a4","observation_id":"4604f3a0-ff6b-4c15-b94e-32d5feffcd74","resolution":{"observed_at":"2026-08-02T19:41:31.172392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2604.02073","last_updated":"2026-04-20T03:16:36Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T14:04:53Z","title":"PLUME: Latent Reasoning Based Universal Multimodal Embedding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T21:48:40.722921Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2604.02073"},"observation_digest":"sha256:7c470745621678916183a15a4c86a7bdadfc7ff5cd643f865e08cf46dc90bc4a","observation_id":"2346178e-b092-41c7-a44a-ce6802d66eb7","resolution":{"observed_at":"2026-05-13T21:53:19.962706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:46:30.827346Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:ab2322b7013ccc3d8330c2b0db2618788c8a111e57ab7edbf28aa7b11e348d39","observation_id":"155bb17e-45e4-4b13-bf9e-465976c22e96","resolution":{"observed_at":"2026-05-11T19:01:19.810359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-12T18:31:37.144968Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T18:31:37.144968Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:b496938cee26f3891bae83bdd9dd2233ba2f5675ce2769127d6c384762cb4f48","observation_id":"3f1d2f26-f696-4c90-9b78-03891cb2e354","resolution":{"observed_at":"2026-07-12T18:31:37.144968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-08-02T15:40:29.103187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-02T15:40:27.791487Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T15:40:29.103187Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:6b9a58bbb8fa074bc4156f8a917e95f6b9c1cdf57f66ab7235d129459aeb1311","observation_id":"6e2d8627-e61f-471e-8fb1-880581564494","resolution":{"observed_at":"2026-08-02T15:40:29.103187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:64ce149d2aa48755579194161090ab00e9babbdecde75c5bc3c798dcf5d47790","observation_id":"4d7edc2b-ef31-4c3e-b2c7-0e5a977e11f5","resolution":{"observed_at":"2026-05-11T19:06:10.555032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.21832","last_updated":"2026-05-26T21:00:35Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-20T23:52:51Z","title":"FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T08:21:06.959344Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.21832"},"observation_digest":"sha256:9c486516887cdf4c205335145269804835bbec4e0acd0d2edf8ac711be5149c3","observation_id":"df16cd08-1747-4e39-93d3-9260da89c2f9","resolution":{"observed_at":"2026-05-22T08:21:16.786986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.21832","last_updated":"2026-05-26T21:00:35Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-20T23:52:51Z","title":"FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T16:45:43.932116Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.21832"},"observation_digest":"sha256:99e1b74283e3c5b967b42bc1fbd5a95665ea7fa20924114f18b82322245dcd27","observation_id":"175ad642-69e0-43ee-9928-e0b288c9fc5a","resolution":{"observed_at":"2026-06-30T16:54:59.172275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:2562b068185359ce44b2a4f3728e75f7c420093bdb393bd31da627ed076a90c2","observation_id":"7ef45a18-3a16-4182-b019-468cb531e09f","resolution":{"observed_at":"2026-06-29T18:23:50.317846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2606.07654","last_updated":"2026-06-03T02:57:09Z","snapshot_observed_at":"2026-08-03T13:06:29.213397Z","submitted_at":"2026-06-03T02:57:09Z","title":"MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T06:59:06.801340Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2606.07654"},"observation_digest":"sha256:3dc7a3c7f138176afcbdb411c9d8deb11904038c7f1552eea941fb96fbb60d36","observation_id":"f86d2da2-9aa9-42e3-b9be-d9577ab89c77","resolution":{"observed_at":"2026-07-02T07:26:45.639136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-08-07T18:30:14.527131Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings.arXiv preprint arXiv:2506.23115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06060","last_updated":"2026-08-06T14:04:56Z","snapshot_observed_at":"2026-08-08T20:17:13.554480Z","submitted_at":"2026-08-06T14:04:56Z","title":"Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:30:14.527131Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2608.06060"},"observation_digest":"sha256:4dc1d5aca017130a69b710c02098c128fde151f5b2b70721f7d55edd58235277","observation_id":"7f1dddab-eb44-4019-8c3f-db21b1a3070f","resolution":{"observed_at":"2026-08-07T18:30:14.527131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23115/citation-record","integrity":"/paper/2506.23115/integrity","json":"/paper/2506.23115/citation-record.json","paper":"/paper/2506.23115"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T21:52:21.406024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.406024Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:f542eaf3bb100d8727ac6cdbede342639737734b7ee1fa6cea7821b97a37c2d1","observation_id":"12acaddd-f71c-4817-9d01-a3f52b1362f7","resolution":{"observed_at":"2026-08-06T21:52:21.406024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:52:21.501578Z","title":"Qwen2.5-vl 10 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.501578Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:3a8585294c565c017e045cad91dfcce5c9a4093b48d3c2bc8e2392ff742f84e8","observation_id":"82d96836-307e-4b52-9786-ff31030520a3","resolution":{"observed_at":"2026-08-06T21:52:21.501578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.581303Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.581303Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:29632084728a31eb0e68c2f72f9f52ac539f30b990648a027c3b81a27f4cc5fa","observation_id":"909fba20-31a7-404e-aec4-813509e6093f","resolution":{"observed_at":"2026-08-06T21:52:21.581303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-08T03:53:14.177644Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-06T21:52:21.664520Z","title":"Llm2vec: Large language models are secretly powerful text encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.664520Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:d1d3d889ccf162ee16b0b4bbb20d85753274c6370a64e4ce85555eae0a9f5786","observation_id":"435d780e-2ef9-4dae-8ff7-148ce382aeef","resolution":{"observed_at":"2026-08-06T21:52:21.664520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-08T04:55:27.349420Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-06T21:52:21.757887Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.757887Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:d702d6a75275dba029c00ef7e2c82984cd63cf13e02f1f5444e65e167dcada71","observation_id":"8ef96816-7451-403d-b809-34d0de0c171d","resolution":{"observed_at":"2026-08-06T21:52:21.757887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T21:52:21.862210Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.862210Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:2fe56a5944d799d603e47d104d5dd0bc5fa0557a93054928053b55a603ee47fd","observation_id":"6bb383f2-3ef2-4592-b394-8b50ba4b9ab0","resolution":{"observed_at":"2026-08-06T21:52:21.862210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.927001Z","title":"UNITER: universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.927001Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:6263e1bae143ed1b10e9c5a2bde42c2f1cdf40b613a77a99f6faab323586d3c1","observation_id":"d6831270-7664-4226-a823-c87311c8f726","resolution":{"observed_at":"2026-08-06T21:52:21.927001Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.042338Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.042338Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:f3e7383e34ff46d9eb68b528cafd17dbe61ec15c067478f71da93cbb651291e5","observation_id":"ba50800f-6021-4c9a-b239-f00b9671e97f","resolution":{"observed_at":"2026-08-06T21:52:22.042338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.730701Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"cad807c6-a5b2-466c-8aa9-08c64d2c1fa9","year":2019},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.118312Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:250a29a950d632722b7003e547e0fb525cb6f9024d9af38d0477d3633e2e8747","observation_id":"74616016-8654-4317-99d1-9ff2b53422f4","resolution":{"observed_at":"2026-08-06T21:52:30.802175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.587207Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"d4971be1-da89-4882-9f09-d1b96028b3cb","year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.378707Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:179ff19393d83b2b97ffd4fdee2787ad30fcb1ac979975a4865dd64540e95d9a","observation_id":"8d2775c9-e589-4a2c-9b28-fad78c05067b","resolution":{"observed_at":"2026-08-06T21:52:30.661796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T21:52:22.484484Z","title":"SEED-X: multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.484484Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:05a833a95618c7959c1d0bbc24f483c885b4e1d7e85751a567a141e98185964c","observation_id":"2cb5873b-4130-4d15-a942-5302520d6146","resolution":{"observed_at":"2026-08-06T21:52:22.484484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04701","last_updated":"2025-07-07T17:49:51Z","snapshot_observed_at":"2026-08-08T08:39:08.267633Z","submitted_at":"2024-09-07T03:54:46Z","title":"Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04701","snapshot_observed_at":"2026-08-06T21:52:22.602494Z","title":"Late chunking: Contextual chunk embeddings using long-context embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.602494Z"},"links":{"cited_paper":"/paper/2409.04701","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:84a527d649369b61279bc2fb23aefbc075bd01279e64a3fb4af1fda4b6067fbd","observation_id":"b1c4f88b-a3a4-4dea-b468-f8ca7bdfed86","resolution":{"observed_at":"2026-08-06T21:52:22.602494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:52:22.687226Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.687226Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:8556f5a171444c859268ebc0385703a85b2dcc2d9ff79298e32f7f497ade51a6","observation_id":"de573936-c557-4175-a5a9-a506d29443bb","resolution":{"observed_at":"2026-08-06T21:52:22.687226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.796886Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.796886Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:61dcddc0e3a5cbc5c6d32db67d77438d7eff5a3bb50d4ccf22ec56703987fc9f","observation_id":"e154328b-0d4a-4b0d-b4bc-2725ca9bb854","resolution":{"observed_at":"2026-08-06T21:52:22.796886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.908229Z","title":"Le, Yun- Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.908229Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:2714e385ba723b6ce1870319eb4f1f31e54f059d1036a4ebb2a07512456c3089","observation_id":"a6dbd464-fc12-49f0-9ff6-258cd273f447","resolution":{"observed_at":"2026-08-06T21:52:22.908229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-06T21:52:23.138389Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.138389Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:03caaa9724ddab5309fd18907fecf1a658ea9f9240459bedca401f746b98069b","observation_id":"f8732002-6067-48ac-8ef8-632b373dee34","resolution":{"observed_at":"2026-08-06T21:52:23.138389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.390537Z","title":"Continual pre-training of language models","venue":null,"work_id":"3c088cc6-d111-4318-9a68-c632cd282fd0","year":2023},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.199431Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:d8bb725490a2ecfe589de7bda6db4787aedd2116fabff4d355f48ac47a814617","observation_id":"67d2c4ad-3ef7-497a-9315-4477152a8d1f","resolution":{"observed_at":"2026-08-06T21:52:30.479218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.210641Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"62d7273a-0380-479e-89ad-9491e8fb9e18","year":2021},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.291964Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:1bf30f2e88ee4360fc111ce4b06262af5f6a883b575b04c34ec96f5a4cf5ba9a","observation_id":"54ae3e34-60d7-4074-a352-4bab87dc0a52","resolution":{"observed_at":"2026-08-06T21:52:30.295768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.463875Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.463875Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:913941b8e8680367456cd218b511d9b895a7e7cde8f7a08a8532623283c85e72","observation_id":"43747104-f690-45a4-bb11-b893ba5279eb","resolution":{"observed_at":"2026-08-06T21:52:23.463875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-08T02:32:36.154874Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-06T21:52:23.673554Z","title":"Building and better understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.673554Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:8e0e750c4a5e3be34c10460a64efa31c02881d83469f5d81173bf5fa5eacd25a","observation_id":"2021fc53-9986-495d-b081-c67fdc160c3b","resolution":{"observed_at":"2026-08-06T21:52:23.673554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.025138Z","title":null,"venue":null,"work_id":"87028cf6-5417-436c-8251-c5dde1755faa","year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.382898Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:70f566a181aa591f5a816e65ca9fbf4fc57bcfe1f9a9ae3596b794d9e43ac296","observation_id":"2cb4484a-1647-4fc6-96ed-38e9d8b51b7c","resolution":{"observed_at":"2026-08-06T21:52:30.115856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.732647Z","title":null,"venue":null,"work_id":"726d268e-d347-4f42-89f3-a498c31865ae","year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.942267Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:04bba6be455dd76f507fce492229be5537bf8a8325b0f7b5aef31bd576884f28","observation_id":"e88daa49-3aaa-4164-9451-0c643901b11c","resolution":{"observed_at":"2026-08-06T21:52:29.815446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.533050Z","title":null,"venue":null,"work_id":"57f1ce8b-5a87-4f8e-b5e1-2155e2073f43","year":2022},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.064803Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:9338d3dcdc4655e0fa9197568c8d1fac5ecafb07b78309aefd5f5ef88f32c2ad","observation_id":"2fc0f898-7539-423c-9f07-a3f2c902346f","resolution":{"observed_at":"2026-08-06T21:52:29.616930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.361610Z","title":null,"venue":null,"work_id":"a3a4d90c-b143-4619-a7e0-6e9f94eba1c7","year":2023},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.181614Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:22539d457ad11cb46caeb017f101401233581a1339c4ab0b6e7252ff8445e37a","observation_id":"27326480-7e37-4820-8117-a9e3fe2741b6","resolution":{"observed_at":"2026-08-06T21:52:29.440599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-06T21:52:24.269954Z","title":"Towards general text embeddings with multi-stage contrastive learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.269954Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:21759233878a665aca5a982843a146b0a827a3bd3fda6939cb0ba87d778223f9","observation_id":"a198e8bd-8db9-432a-8644-fe2d8b5e600b","resolution":{"observed_at":"2026-08-06T21:52:24.269954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.893314Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":"a422ace4-75e8-4f02-8755-558aadb3188c","year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.851285Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:e416942e3af3a26c50e98ee308bc43d6753445187dd4ca7018b524a6e22f9699","observation_id":"467cab76-10a2-4460-b58f-003ed0a09128","resolution":{"observed_at":"2026-08-06T21:52:29.950680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.483412Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.483412Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:bb52fe4a3ca513ac24d293cd7c1568cb103b922faeec98c7fd1562bd315f3382","observation_id":"04a6f182-78a7-4c78-bd37-b931664633a0","resolution":{"observed_at":"2026-08-06T21:52:24.483412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.165009Z","title":"Unify- ing multimodal retrieval via document screenshot embedding","venue":null,"work_id":"d847acf7-427a-4e10-922e-f8a941085144","year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.556343Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:58445e79bc8b77ba1814b61775d72ee4b833902d03cba1bbc38b8122702642a4","observation_id":"40dacb9d-03dc-4323-9b56-d3b19b99167b","resolution":{"observed_at":"2026-08-06T21:52:29.257243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-06T21:52:24.627791Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.627791Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:0cc2df8f957aa606a29b87d18b78fb74cbb86253cebaab55dd4d497ccdce5293","observation_id":"de5e1ea6-d8e2-4010-b025-6c62838ceed3","resolution":{"observed_at":"2026-08-06T21:52:24.627791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:28.893709Z","title":"Introducing meta llama 3: The most capable openly available llm to date, April 2024","venue":null,"work_id":"a1654c6c-0817-492b-a894-19110213d505","year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.672117Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:b7e2c9330fc69b9cb25e19f037b5d1111d233be4ea465a6095fca28dcddf6f8c","observation_id":"e4a46cba-2329-4e31-91f6-92d767521cf4","resolution":{"observed_at":"2026-08-06T21:52:29.007803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.721367Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.721367Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:73e3e8bcbd5e98d0a2622432e89539f442bcc9514e3d21bbd397b4226c9c56b4","observation_id":"27f972d3-bcaf-4402-ac69-6c91923ce885","resolution":{"observed_at":"2026-08-06T21:52:24.721367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-06T21:52:24.419284Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.419284Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:38c3377d23b9ca6ee2633214ec0ce8ceeb9d247b37e5f9d3754c479cd07378ea","observation_id":"b54f5c2c-b25a-4369-8aeb-aafe3724a387","resolution":{"observed_at":"2026-08-06T21:52:24.419284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T21:52:24.853435Z","title":"LAION-400M: open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.853435Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:9008a7419ca1ed9da2f8df64e31a86eb4e4665b38e686410ba86d2becc656d85","observation_id":"33f331cd-9b92-4920-8f2d-4923efaa5809","resolution":{"observed_at":"2026-08-06T21:52:24.853435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T21:52:24.893267Z","title":"From pixels to prose: A large dataset of dense image captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.893267Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:ae2fe6b2ce316ceef36d0c1097db6ee5ea6eccaf34933819b2b0764bc69f96fc","observation_id":"4aaaa547-1faf-4365-b5ba-e27ee147e874","resolution":{"observed_at":"2026-08-06T21:52:24.893267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:28.616725Z","title":"Repetition improves language model embeddings","venue":null,"work_id":"26008fb9-0036-4766-9b80-29530ddd495c","year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.962392Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:5490e586f1aeb29fd711b6bce5d6b9ea4bfd2241af23f936e556e3507ad536a8","observation_id":"9a1d01eb-cbd1-4ecf-bc7a-68583e134752","resolution":{"observed_at":"2026-08-06T21:52:28.720479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:28.401511Z","title":"LXMERT: learning cross-modality encoder representations from transformers","venue":null,"work_id":"bb96387b-04cb-4a26-ae06-c670dfd18e16","year":2019},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.018644Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:6bb7ec124dee405184fbecc78e52234302a61fda0db9d3d1d09f174067acdd7e","observation_id":"c75817ac-a642-436b-97f9-5059288eb293","resolution":{"observed_at":"2026-08-06T21:52:28.497621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08663","last_updated":"2021-10-21T01:18:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-17T23:29:55Z","title":"BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08663","snapshot_observed_at":"2026-08-06T21:52:25.118584Z","title":"BEIR: A heterogenous benchmark for zero-shot evaluation of information retrieval models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.118584Z"},"links":{"cited_paper":"/paper/2104.08663","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:8759857c617c27b10f4465cc36a7b1a0b9fca952b325661052d5d2971ea973bf","observation_id":"86f98179-3dd5-419a-85b2-f97c92455e12","resolution":{"observed_at":"2026-08-06T21:52:25.118584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T21:52:24.800410Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.800410Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:96173bdf2b67027d00fd340c1a6714a656694fbce30e3d114a6f89737171a65f","observation_id":"5bafc57e-5de7-4b00-b17c-64d39f540fec","resolution":{"observed_at":"2026-08-06T21:52:24.800410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-06T21:52:25.252459Z","title":"Text embeddings by weakly-supervised contrastive pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.252459Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:5735dae6b6fa57d805653d76c63a70584f7295c378498a8a9d3efb133ea6e7da","observation_id":"0f2bbf62-cfd6-4313-b2fd-2552ff1808fc","resolution":{"observed_at":"2026-08-06T21:52:25.252459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:52:25.314513Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.314513Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:f1c88c7b84c49179dc309df9fabab6c516a70cd6ac68a9e6e3258cc66389b7bd","observation_id":"17a275a2-6222-4a70-afc4-b1203795b1cb","resolution":{"observed_at":"2026-08-06T21:52:25.314513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T21:52:25.380540Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.380540Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:f1343c760752d61969298a1db4f2c91d49a9906f5b8c798f8d559af547457723","observation_id":"751f62b2-c372-41a7-aa00-ceaba5a439fe","resolution":{"observed_at":"2026-08-06T21:52:25.380540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.446061Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.446061Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:b77f46b87d184eae333652c1528b00897d2b9858e45521319ac5fca109e99c19","observation_id":"1f4645f2-7322-4014-8f1c-438cecd41c9a","resolution":{"observed_at":"2026-08-06T21:52:25.446061Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T21:52:25.514246Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.514246Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:c0c382e5b162e92c5bc45667f95c8d22b7a29fdd9954cc0ec5ac4c34dd03fb29","observation_id":"c1c72e75-c1c5-4c1c-a89c-8b1a88ab05f9","resolution":{"observed_at":"2026-08-06T21:52:25.514246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.582577Z","title":"C-pack: Packed resources for general chinese embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.582577Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:458120a75c86d63025bbf5d3702658a87fd50547fde05d57bfe908a9e916cb54","observation_id":"4a860906-83a2-4e4b-b708-f105f1a163e1","resolution":{"observed_at":"2026-08-06T21:52:25.582577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T21:52:25.203463Z","title":"Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.203463Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:c8d90d25ff986cbbabd107e9c8b4da546568a05dae1b038d5564391fc47faa15","observation_id":"cb2ad355-3c09-430c-a8e1-a6584a9659b6","resolution":{"observed_at":"2026-08-06T21:52:25.203463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.702492Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.702492Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:29a8353d688b59de0698813d480b78f98bb067473a9373a54c9055cb0f25976d","observation_id":"a21ad657-6990-46c3-84f9-2d33bc8c9f1b","resolution":{"observed_at":"2026-08-06T21:52:25.702492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.706693Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.706693Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:8c5c25bec94150b398c637ea0508057cb3470ae4532ef62ee89e5d269cae60bf","observation_id":"5bcfa3ea-7f46-49e2-a258-dc5fa0a2f259","resolution":{"observed_at":"2026-08-06T21:52:25.706693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:27.841909Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"5db440ac-dc23-4979-b083-196b4ce8e4fb","year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.778184Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:68b9b837685324ae17b1b06cdb3986d57f663151c5a4b73f4aba4c83d9366b0d","observation_id":"e487b7ce-63d3-43cf-9f82-aaed71d2ba84","resolution":{"observed_at":"2026-08-06T21:52:27.972882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-06T21:52:25.999631Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.999631Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:751be33efcf40e68f7895dc6a22e36b3d331c6b4f0fbae8708dba93e45d16bcb","observation_id":"38281db6-a1d0-4a2c-9c01-50fb9d8760fe","resolution":{"observed_at":"2026-08-06T21:52:25.999631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T19:57:52.498782Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T21:52:26.204540Z","title":"QLIP: text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.204540Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:1a6059999a362978533a150be9835a5780a0a8512157c443e1ae321e0c18765b","observation_id":"e389c8ad-e413-4311-96c6-dedb6e571120","resolution":{"observed_at":"2026-08-06T21:52:26.204540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-06T21:52:26.368534Z","title":"Megapairs: Massive data synthesis for universal multimodal retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.368534Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:83b5e42487e0a40ed5973ea3619a253ab1882fc096a76266d8848661bf79f060","observation_id":"ea48ff13-bf4e-40f4-a2a4-63577caebc06","resolution":{"observed_at":"2026-08-06T21:52:26.368534Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:28.109545Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"5e466804-1873-45f0-a9f2-87c68e9b896d","year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.635632Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:b34a73e3213637b2fa80eb7cc9b219f7820ab72ef5205ff00cef792937bc7b6b","observation_id":"2f62bcb9-a8b1-4ee3-ba58-d06d0b7c1ae4","resolution":{"observed_at":"2026-08-06T21:52:28.277738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.064163Z","title":"URL https://doi.org/10.18653/v1/D19-1514","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.064163Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:46a061c2582ad026b98053b33e28f5bc102874003db40b0e2dd12fe172766b42","observation_id":"567955fb-40b2-4acc-930a-47ea0fb70693","resolution":{"observed_at":"2026-08-06T21:52:25.064163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.026072Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.026072Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:6803bd65b6209afd04105feff3fa4f9593caa7a11adc9e7a3bb14f5fea82ea0d","observation_id":"ecbc4db1-4b25-4932-81d6-0100114c236c","resolution":{"observed_at":"2026-08-06T21:52:23.026072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-06T21:52:24.355520Z","title":"URL https://doi.org/10.48550/arXiv.2308","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.355520Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:7abba702bf3d5a7f8bdbf792d80a9cf3b9915cbfb7a454fc82db18c4b5eb090c","observation_id":"79d78f86-b5d3-4f1a-9513-935d111541e7","resolution":{"observed_at":"2026-08-06T21:52:24.355520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-08T02:32:36.154874Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-06T21:52:23.743202Z","title":"URL https://doi.org/10.48550/arXiv.2408","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.743202Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:769271da51d189885bd8a68bc47230be969c9fa760e597cbe3bf5ff980eba0bc","observation_id":"de154433-0b74-42e1-91f1-83e5f4c6ba35","resolution":{"observed_at":"2026-08-06T21:52:23.743202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.04812","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.936178Z","title":"URL https://doi.org/10.48550/arXiv.2503","venue":null,"work_id":"01f536cf-cac9-47b0-aa00-becb56526c2a","year":null},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.579127Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:49058f8813c2ab86aaa5dfbd71f48691276f5cc65ad518454812b4b91bb85c67","observation_id":"e3d2d85c-1d26-4dfb-95ab-6f1377d6f745","resolution":{"observed_at":"2026-08-06T21:52:27.096202Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.242467Z","title":"doi: 10.18653/V1/N19-1423","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":4186,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.242467Z"},"links":{"citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:544d3b94afb968d8a0d404e3b2e7e503537abbff59f0556803014584db0dc3b0","observation_id":"338e1be0-732f-4800-ad45-472d56d5bf8a","resolution":{"observed_at":"2026-08-06T21:52:22.242467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 13 inbound Pith citation observations for arXiv:2506.23115."}