{"as_of":"2026-08-08T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b2a718c64c4ec3ff4359a16a0ca8ac0b730044be54f1f639417dbeb228a863d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:05:31.866869Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:12:07.548447Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:20:53.347635Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"cited_work":{"arxiv_id":"2506.06144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06144","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clamr: Contex- tualized late-interaction for multimodal content retrieval","venue":null,"work_id":"b5a92801-9338-4b95-bd79-7dac67a82509","year":2025},"citing_paper":{"arxiv_id":"2604.05834","last_updated":"2026-05-07T07:23:06Z","snapshot_observed_at":"2026-08-07T00:25:25.000753Z","submitted_at":"2026-04-07T13:03:30Z","title":"Hidden in the Multiplicative Interaction: Uncovering Fragility in Multimodal Contrastive Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T19:12:07.548447Z"},"links":{"cited_paper":"/paper/2506.06144","citing_paper":"/paper/2604.05834"},"observation_digest":"sha256:bcc4629791dfd21d945327f31c9da5817ba0165b07759bbd3e8bb258fd6ab8ac","observation_id":"1c39de2c-01db-44ed-a743-64a7eb788bcd","resolution":{"observed_at":"2026-05-10T23:20:53.354526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06144/citation-record","integrity":"/paper/2506.06144/integrity","json":"/paper/2506.06144/citation-record.json","paper":"/paper/2506.06144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.634670Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.634670Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:7ab1005d49665551e2a11d43b0862c1158e963af6887da4671426686e357669e","observation_id":"19dd6684-388b-4cb7-be7d-caf1c71fb844","resolution":{"observed_at":"2026-08-07T06:05:31.634670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.729244Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"3c1e6a46-6b34-411e-bfb5-f7e3df9acd85","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.644806Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:dada9e2d019f53239621b7dafbe2e67796b215a68369d12c284b776a5122eaef","observation_id":"9c47f90b-1e70-4dbe-9359-ec944a84271d","resolution":{"observed_at":"2026-08-07T06:05:32.732933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.709757Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset, 2023","venue":null,"work_id":"206dcf2d-fc83-40da-9b1e-2d2bee7cd0a4","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.652579Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:aa9e2457b23b98ff7108bc8a02a7f54ff6b6a34e3915049204663a18c8ef3162","observation_id":"4d14f39b-27d1-4e85-af09-9a0b17dcb282","resolution":{"observed_at":"2026-08-07T06:05:32.713163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.698394Z","title":"V AST: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"2e78a4c1-23d9-4fbf-a2f1-7e3e5c963c97","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.656440Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:65d94715e69d04e5d6d13cedb2af5999ac0af9ca3554da5eebaf638b2a6de669","observation_id":"204d3d2f-313a-435e-bdbf-f9d933524ab9","resolution":{"observed_at":"2026-08-07T06:05:32.702081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.688726Z","title":"PaLI: A jointly-scaled multilingual language-image model","venue":null,"work_id":"bfdc11c6-87fc-4722-813f-efff4fb3b325","year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.661364Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:f5441acc4b30893455164c3e6792b724bc0621b54cb9dbaa94e6c29f11305e4f","observation_id":"4e6e1dea-47dc-4f43-9209-8bdd96927bd8","resolution":{"observed_at":"2026-08-07T06:05:32.691985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.679381Z","title":"M3docrag: Multi- modal retrieval is what you need for multi-page multi-document understanding, 2024","venue":null,"work_id":"335ef3b1-bdea-4032-9f5c-6540934807c5","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.666238Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:a7887855e61db7c507ff2ef4fabdf307f743b16412d425428c76d095a8aa8da6","observation_id":"4041aeb2-69d3-403c-9bbd-41e128cb652d","resolution":{"observed_at":"2026-08-07T06:05:32.682596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.669461Z","title":"Jacolbertv2.5: Optimising multi-vector retrievers to create state-of-the-art japanese retrievers with constrained resources, 2024","venue":null,"work_id":"601e99c6-bc12-4b50-a8b6-8403c52f2832","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.675998Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:aad7fecb4dd89d40f9303714199f41dda4dfd38feb6970cace96850d4284c2a3","observation_id":"c196a0ea-c869-4dbc-8144-f7bd9a7b07ff","resolution":{"observed_at":"2026-08-07T06:05:32.672817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.680329Z","title":"Cormack, Charles L A Clarke, and Stefan Buettcher","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.680329Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:6338d1e11e87d561466424aad96dd4c436560c419627531a929f39c612861da7","observation_id":"823aed3b-6806-41b2-87b7-e11f5308cda9","resolution":{"observed_at":"2026-08-07T06:05:31.680329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-07T06:05:31.684465Z","title":"Qlora: Efficient finetuning of quantized llms.arXiv preprint arXiv:2305.14314, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.684465Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:a58cc1cd500dc6d2b7d355d9698f834903aa9b726f9bf55afdb3b53378afdc95","observation_id":"fdb88050-ddff-42c2-a84a-9587fc3bd8b6","resolution":{"observed_at":"2026-08-07T06:05:31.684465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.659492Z","title":"Tibshirani.An Introduction to the Bootstrap","venue":null,"work_id":"edc010b8-2cff-4eb5-b2df-6a3cc8afddcd","year":1993},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.689461Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:641121788f33e2ae87c8abc7cdf18fbf6407d81f9fa02d25e377f36cd8d02195","observation_id":"e94752d0-2164-4e0b-b8ee-8b410a9fdcc2","resolution":{"observed_at":"2026-08-07T06:05:32.662854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.694040Z","title":"A hybrid model for multilingual ocr","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.694040Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:fa94d31ea07adb63f1141f3bd6b8a15874d59269f24e309879cc06d449d885c4","observation_id":"503b32ec-c227-4ad7-83b1-328a0819f599","resolution":{"observed_at":"2026-08-07T06:05:31.694040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.648489Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":"31098870-3b06-457e-a7bc-3aebd1e0d053","year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.698596Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:4dac360c896a426b2f953a170d0dd06cbb15490009be65a23a3d9d9a9d91a874","observation_id":"03718175-bbd6-463d-ac4a-df5eb644d7bc","resolution":{"observed_at":"2026-08-07T06:05:32.652851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T06:05:31.703431Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.703431Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:a1d21a31588625d3e939a829b3cc22dfa66e463bbff37a8b5b833e7e4edce47e","observation_id":"a61972d4-f41b-4aed-9ad7-4321c77f102a","resolution":{"observed_at":"2026-08-07T06:05:31.703431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.708822Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.708822Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1d964405ad4c70ecf7edc6dca637a670837cacefbca4591924e9e48e4d02394c","observation_id":"16671a50-c346-45eb-bcab-944ba321d299","resolution":{"observed_at":"2026-08-07T06:05:31.708822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.713608Z","title":"Cumulated gain-based evaluation of ir techniques.ACM Trans","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.713608Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:6c71f0d97eb9f5cf6a4a4052a1c4132f41c37a865038795ab9be3e214c514af7","observation_id":"507fc0cc-77dc-41f6-819b-9aa209ddced5","resolution":{"observed_at":"2026-08-07T06:05:31.713608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.631942Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"aa579397-d696-4523-819f-35fe1a2b19a1","year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.718360Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:fa456e07de325d47cf4357c169c102cb0dfc9ac0cc3a724750a40ab6f51b4be3","observation_id":"552d9585-d1f9-4858-9c82-fde725678c36","resolution":{"observed_at":"2026-08-07T06:05:32.635323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-07T06:05:31.723331Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.723331Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:616d215c6bbef630f4391daf62c6874a8a0029ac0fc4285fc3532853946978fc","observation_id":"2fb790ac-e2f2-40a2-bf1c-aebbb741db7a","resolution":{"observed_at":"2026-08-07T06:05:31.723331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.728907Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.728907Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:63871ad2b5495b56532b21f3662db83e79b31c6fa40645f7a87f452e0da4adcf","observation_id":"7ad71b70-7828-4bcd-926a-111f73edcdc4","resolution":{"observed_at":"2026-08-07T06:05:31.728907Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.734527Z","title":"Colbert: Efficient and effective passage search via con- textualized late interaction over bert","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.734527Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:265566ca884575eb2afafc927aaca77c47e5005b0feb61417b3e29390bfb68bf","observation_id":"5d801cd2-d676-4a75-ba06-a2f17672d1ac","resolution":{"observed_at":"2026-08-07T06:05:31.734527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11619","last_updated":"2025-02-10T17:26:40Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T13:56:34Z","title":"MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11619","snapshot_observed_at":"2026-08-07T06:05:31.738189Z","title":"Multivent 2.0: A massive multilingual benchmark for event-centric video retrieval, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.738189Z"},"links":{"cited_paper":"/paper/2410.11619","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:352fb816fbd35bf454f746820a3d3ff056456b125d13a5a4c5765ef641222075","observation_id":"65563c93-0fa7-45b7-bbe9-24eb6fa33d41","resolution":{"observed_at":"2026-08-07T06:05:31.738189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.742958Z","title":"Learning to rank for information retrieval.Found","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.742958Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:437f7f05c22d2652b0638b5ae012f5ae0b97d6ec83f7fc0bdeb1d52c04399254","observation_id":"7ba335fd-29dc-4963-95c2-4718223f64d4","resolution":{"observed_at":"2026-08-07T06:05:31.742958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-07T09:11:01.956830Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-07T06:05:31.747047Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.747047Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:8f4c8815f08c5c4d0a770a63ef23348b94bc8d6b153f288a0ae689228c3d87ec","observation_id":"4a36bfaa-22be-4fb5-92c1-7335d9074463","resolution":{"observed_at":"2026-08-07T06:05:31.747047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.751704Z","title":"Handwritten optical character recognition (ocr): A comprehensive systematic literature review (slr).IEEE Access, 8: 142642–142668, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.751704Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:529a46f5572f408b891edabe842e7057be1a5f7a33292667d357f2b520328429","observation_id":"3a544e91-f00c-4ccf-963a-beedaf9bccc3","resolution":{"observed_at":"2026-08-07T06:05:31.751704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.621356Z","title":"Vladva: Discriminative fine-tuning of lvlms,","venue":null,"work_id":"f0211c3b-0cfe-495c-a1f1-6f894478b8f3","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.755787Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:0a23b0e1d2b60388af49111dc7017530b0140ca5cbf6cf691dd438afc22f22c4","observation_id":"3363841f-0da7-4353-aa11-8fee73981574","resolution":{"observed_at":"2026-08-07T06:05:32.624648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.764683Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.764683Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:4141a911b6ef3cfdfaee40ae2f7262b6246fec8b51ce2694753c6cf71d18b0f7","observation_id":"58b2133a-98ee-49e3-921d-dad0b7892035","resolution":{"observed_at":"2026-08-07T06:05:31.764683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04378","last_updated":"2025-05-08T19:16:29Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T17:54:27Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","version":3},"cited_work":{"arxiv_id":"2412.04378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04378","snapshot_observed_at":"2026-08-07T06:05:32.153318Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","venue":"cs.CV","work_id":"42eb6bcf-dc23-4aa6-b716-37fcd4104581","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.760413Z"},"links":{"cited_paper":"/paper/2412.04378","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:103fc061344876c9e85be6e9e75e4434a167cbfc4db74977866325e94b973aaa","observation_id":"642bb0b5-4a42-48eb-aa70-618792b5bc56","resolution":{"observed_at":"2026-08-07T06:05:32.158935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19009","last_updated":"2025-03-24T17:51:29Z","snapshot_observed_at":"2026-08-07T16:40:28.580445Z","submitted_at":"2025-03-24T17:51:29Z","title":"Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19009","snapshot_observed_at":"2026-08-07T06:05:31.776301Z","title":"de Melo, Benjamin Van Durme, and Rama Chellappa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.776301Z"},"links":{"cited_paper":"/paper/2503.19009","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b0e0b004d8273e26cc69ea125f422ec964ab840e80c171e8747bedb4c46e24db","observation_id":"5c79f5b3-dc2d-496f-8114-a8704e143b80","resolution":{"observed_at":"2026-08-07T06:05:31.776301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T06:05:31.780127Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.780127Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:c6dbc9ff7b6ef09a6f40bf2adcafde2f53088d6b5181596c25c4e70f34967ae4","observation_id":"5c85e58a-1f3e-4e94-a994-50e76e1fc131","resolution":{"observed_at":"2026-08-07T06:05:31.780127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T06:05:31.772749Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.772749Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:273808c6433359e6e21c87da9dd4d6c7ba4b2e5d84cdbcad6ff9876daa1b6009","observation_id":"63cd450c-52ea-467c-b862-0b91c26bfd4f","resolution":{"observed_at":"2026-08-07T06:05:31.772749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.790322Z","title":"ColBERTv2: Effective and efficient retrieval via lightweight late interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.790322Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:f984a4411501b87ff80592d8e3f193f2f28d3c467c375103bc9877539bdf66e1","observation_id":"1ae11b3e-74b7-4d9c-a018-5a43742991c4","resolution":{"observed_at":"2026-08-07T06:05:31.790322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.795910Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.795910Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:5773f292e05c7e2eb860fdc01945732a254bf120d2f3df8b641765d2b4c3df04","observation_id":"d37da703-0756-46f2-b5ff-e95065c779c1","resolution":{"observed_at":"2026-08-07T06:05:31.795910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20698","last_updated":"2025-05-09T15:18:56Z","snapshot_observed_at":"2026-08-07T16:35:03.898190Z","submitted_at":"2025-03-26T16:28:04Z","title":"MMMORRF: Multimodal Multilingual Modularized Reciprocal Rank Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20698","snapshot_observed_at":"2026-08-07T06:05:31.784566Z","title":"Mmmorrf: Multimodal multilingual modularized reciprocal rank fusion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.784566Z"},"links":{"cited_paper":"/paper/2503.20698","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:eaafe9e620f7ab126fb2a3834c0d6a5814157dce94a7d397dce8401337f1b5b8","observation_id":"2a0a17ba-f607-48f0-887f-96847c25dff2","resolution":{"observed_at":"2026-08-07T06:05:31.784566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T06:05:31.804178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.804178Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:5d4143520bac476a709453aab744e52dfdf4337cf177e22afae94acd7410b07d","observation_id":"3036bb25-e930-48d7-bee1-519b5b577769","resolution":{"observed_at":"2026-08-07T06:05:31.804178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.811569Z","title":"BEIR: A heterogeneous benchmark for zero-shot evaluation of information retrieval models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.811569Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:cd3955e60890bbe7d5e5723b75f7b7c5a9ee761e16e709097573d08e3a132507","observation_id":"326d5b02-42de-418b-bea9-d24b4bf7571a","resolution":{"observed_at":"2026-08-07T06:05:31.811569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.598549Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"9c18e021-9736-4976-9cb7-e2d8704ca058","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.800337Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1017afad7cb57eb4aabba186fdf1eee767e56abba91807cf7365ab3532123e8f","observation_id":"4bcb1f75-7ef4-4d63-beb6-aa3633bf30c1","resolution":{"observed_at":"2026-08-07T06:05:32.601741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.582488Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"f5e63be7-458e-414c-a987-f8217df8ecb9","year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.819442Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:5c35589449ee7337de0e86a1ef23a3dec216f4dd2e7c0fa24685c3b7a1c414d5","observation_id":"77fa6841-8759-45b8-aff8-227fbedaaf7e","resolution":{"observed_at":"2026-08-07T06:05:32.586001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T06:05:31.825064Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.825064Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:f753161603497528560b6e0eacd14ee194688bbe6a2de474fa56036c189b25e9","observation_id":"bae2896b-f6e0-4548-b8bc-34a2e87c3ace","resolution":{"observed_at":"2026-08-07T06:05:31.825064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T06:05:31.815340Z","title":"Representation learning with contrastive predictive coding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.815340Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:3ce1aefcc2bbaccfdac11df4f34591cb34927cd2f3b7eb15c723bc8b88c0a798","observation_id":"6f2d055e-5f99-4982-aa01-344b2833129c","resolution":{"observed_at":"2026-08-07T06:05:31.815340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.565598Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"eb14d027-10af-49a0-aff5-086babb88f25","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.833276Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:d638a504035f51d39aa8b6f50f5918c736061c08398bb343b206154d96dc7975","observation_id":"88bb1e5a-a138-4970-8b01-4361cc5500b2","resolution":{"observed_at":"2026-08-07T06:05:32.569152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T06:05:31.843978Z","title":"Qwen2.5-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.843978Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:44fb2ffdb4a0009577c9af0553b971d3174fab937f080891f2b1eeedadfc51cc","observation_id":"868f1be1-500e-496a-b354-79f63cfaeca3","resolution":{"observed_at":"2026-08-07T06:05:31.843978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:31.829176Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.829176Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:58daad3847591b6740492986c57178875fb582df16dbb8b9354b1463d59b2b68","observation_id":"d7dda32d-cafc-4d71-9d8f-2e263aedc925","resolution":{"observed_at":"2026-08-07T06:05:31.829176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20734","last_updated":"2026-05-18T05:53:24Z","snapshot_observed_at":"2026-07-06T21:16:27.689435Z","submitted_at":"2025-04-29T13:18:58Z","title":"UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20734","snapshot_observed_at":"2026-08-07T06:05:31.852256Z","title":"Uni- versalrag: Retrieval-augmented generation over multiple corpora with diverse modalities and granularities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.852256Z"},"links":{"cited_paper":"/paper/2504.20734","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:1186b579e8b923aaa23806e92c8bdd42c9e9bd3722203428fce50bb8f073eed9","observation_id":"91c94b0e-fd37-4767-bc11-35a9a63c640d","resolution":{"observed_at":"2026-08-07T06:05:31.852256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.533894Z","title":"CREAM: Coarse-to-fine retrieval and multi- modal efficient tuning for document VQA","venue":null,"work_id":"be7ebf59-bcdd-435c-b5cd-585453a36a33","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.856797Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:ecc637d3fc5697239c92a7c1332e5922a8cc14d826ab960e4599aa649cd4563c","observation_id":"2677d8dd-e083-4e7c-9b36-385150f719b7","resolution":{"observed_at":"2026-08-07T06:05:32.537696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.522991Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":"8b630115-ebb8-4b87-8eb0-82f67a453914","year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.861838Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:63b9e6f1f5206309c27d601466a9f42d9a47e663fccf16510a5a51d8197bd5ba","observation_id":"cf2fcc13-053f-43f6-a2b5-69eea1c8d835","resolution":{"observed_at":"2026-08-07T06:05:32.526800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.545087Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"f4f0dc79-1848-49ee-b6a2-d9718cebed63","year":2016},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.847733Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:b878e88d9e751b77c45a55b257ac3fbaca44dff6eadafb1741ba160c492a8df4","observation_id":"f2675d97-12d0-44d6-b24c-22b115211bfc","resolution":{"observed_at":"2026-08-07T06:05:32.548489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-07T06:05:31.866869Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.866869Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:70978d9530e7a01e61ab40148bd391b6c534c86bf5538ba09cf35f7fdab3a1eb","observation_id":"42fd1618-52b1-4a1d-8bde-291cbfa58eaf","resolution":{"observed_at":"2026-08-07T06:05:31.866869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.719808Z","title":null,"venue":null,"work_id":"78abcf77-6280-4ab4-a0ff-e54700612505","year":2022},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.648707Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:f4a27eb39497e26de315dc917a63443d22d1fc5d96b12c2e8513dccd4d998e56","observation_id":"79d1128f-70a1-45c3-bf22-9e356735e2a4","resolution":{"observed_at":"2026-08-07T06:05:32.722824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.555540Z","title":null,"venue":null,"work_id":"1ab5fb42-c70b-4f16-877f-aea0059d1fe3","year":2024},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.839371Z"},"links":{"citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:20b76abc5e74f894c01b17f972531c46f339be5c93fb756597d13f02d957413b","observation_id":"245a8727-c197-4289-ba3c-9bed0af1a4b6","resolution":{"observed_at":"2026-08-07T06:05:32.558569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T06:05:31.640938Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.640938Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:5bd340e022605a52c14472ba7301a243534ce020421f8dc7dd9d3ccbff269920","observation_id":"739bd388-8da6-4992-be2b-18cddfdd5aac","resolution":{"observed_at":"2026-08-07T06:05:31.640938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:13:05.310717Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2506.06144."}