{"as_of":"2026-08-06T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1017d717fe0315b503ad958f883eb56bba5421e1f3013a97e65fda8816a1469d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:40:33.437364Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06460/citation-record","integrity":"/paper/2605.06460/integrity","json":"/paper/2605.06460/citation-record.json","paper":"/paper/2605.06460"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning based visually rich document content understanding: A survey.Artificial Intelligence Review","venue":null,"work_id":"8c1ddd87-ab8b-4687-bfa1-88f204ade27b","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:639ec6641f43118d30b414aa1713cbc9f413679e471de879d59dec5a54b8a2c5","observation_id":"b364d428-618e-4eb9-b70c-69d4e37fb54d","resolution":{"observed_at":"2026-05-26T13:07:48.079777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.15253","last_updated":"2026-04-20T08:38:26Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-17T02:33:16Z","title":"Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding","version":3},"cited_work":{"arxiv_id":"2510.15253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.15253","snapshot_observed_at":"2026-07-02T03:36:29.841013Z","title":"Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding","venue":"cs.CL","work_id":"48383ab7-1c0b-4a3a-8b3f-e15fa70948f4","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2510.15253","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:68e08ea918cdc3b83bf42990e061f66c95acc307d15c1b012043ea84653e6234","observation_id":"a63ee639-ec7b-4ce1-b565-79f6c87f42c4","resolution":{"observed_at":"2026-05-11T19:06:10.589628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.079326Z","title":"Unifying multi- modal retrieval via document screenshot embedding","venue":null,"work_id":"ecd85018-f941-4f98-88b0-ced7d9fe5760","year":2024},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:5f55624f9a2e740d88753b6a147e8295550c82d6da8ce7d5d9bfa2b92ad5ce78","observation_id":"7ad879c2-10ae-4111-a5ce-7c699c159407","resolution":{"observed_at":"2026-05-26T13:07:48.040593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ColPali: Efficient document retrieval with vision language models","venue":null,"work_id":"1429e452-5a70-46fd-a617-b06397ef8048","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:f5947387cb9bffeccbf2f9139d061386dbd3da282957953658050315a1a8396a","observation_id":"8df7abf2-1aa5-4a59-8b5e-75cb1b1d9fec","resolution":{"observed_at":"2026-05-26T13:07:48.061813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VisRAG: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":"54c03537-8ab1-4d10-bfc1-3e7195597418","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:d26f0e1c2550dd3ddec9649ef9ce1fcb93702792645027db8f8501241705419c","observation_id":"3ded030d-45a7-4c6a-b7a9-2583602d6493","resolution":{"observed_at":"2026-05-26T13:07:48.076834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ColBERT: Efficient and effective passage search via con- textualized late interaction over BERT","venue":null,"work_id":"4cd21259-a17f-406a-b813-bd97f47ded3b","year":2020},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:9787828111f8d6d8c8dec92b10b5ebcb4d9336ee6cc294675b6aa2146d5f9864","observation_id":"7df24362-045a-4e27-a641-e987c24ce510","resolution":{"observed_at":"2026-05-26T13:07:48.009922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards storage-efficient visual document retrieval: An empirical study on reducing patch-level embeddings","venue":null,"work_id":"c205a8d2-3767-43cb-ba22-d1e4157ff1aa","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:d970fa1a8024668bf29c7b88622df60de1b1fad1e9c816ee5a04ac58ea18eb6a","observation_id":"1fd29631-da25-40e0-aecc-f5855cff1106","resolution":{"observed_at":"2026-05-26T13:07:48.056250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ColBERTv2: Effective and efficient retrieval via lightweight late interaction","venue":null,"work_id":"7453a8e0-0cde-4966-97c4-e46d5a142059","year":2022},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:9ae22752c62c37dd7061673238abbbad8e1127c7338c6f5a4a10b8ae46867db3","observation_id":"fb1fdc9b-da19-4d63-8617-26689da130a9","resolution":{"observed_at":"2026-05-26T13:07:48.050651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:04:08.160806Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":"8bda246b-1418-4ec6-ba83-586cb4430804","year":2020},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:4d12cf3afed9dd15e069c18c1fd80b60a13ab91b457e335d6a0b8be6cd824ca3","observation_id":"2be3f939-e063-4f4a-a22b-835b307a8389","resolution":{"observed_at":"2026-05-26T13:07:48.035355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MM-Embed: Universal multimodal retrieval with multimodal LLMs","venue":null,"work_id":"179b32fe-bc00-4f4e-97d0-6e6d6ca661d2","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:912330a2fbcd5b03e5aa59520ed1e1ce212d5779294b896b49b6555dec0c97f8","observation_id":"bc30b4e0-14eb-4e9a-98dc-00900c61e9cd","resolution":{"observed_at":"2026-05-26T13:07:48.030104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"jina- embeddings-v4: Universal embeddings for multimodal multilingual retrieval","venue":null,"work_id":"ac4328f8-72b3-46c2-a455-2b0a2e854a82","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:137464e9de067d9370ee5ff420d690d9546cb678fc4531f668f572d41939d46c","observation_id":"b45cbb90-c25c-4801-bfc1-b46dcf26ff3b","resolution":{"observed_at":"2026-05-26T13:07:48.047981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Head2toe: Utilizing intermediate representations for better transfer learning","venue":null,"work_id":"42c3a42d-cf45-436c-b14b-99f2a9751508","year":2022},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:9ad76235300dc1fc69c217cf0e7a899258cacc2f93d2b64d3b7f03ee96c1a944","observation_id":"5bb823bd-bfa3-4ec5-bcfb-4a0f98610587","resolution":{"observed_at":"2026-05-26T13:07:48.012065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual query tuning: Towards effective usage of intermediate representations for parameter and memory efficient transfer learning","venue":null,"work_id":"c076a6bc-85e5-47e7-a10a-723bf2242f32","year":2023},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:f9d695a6b84de2436d2551392ddfff86c3e4c7e5d6ba453816cbc5b437b033a0","observation_id":"639746ab-a7a8-4ebb-afa0-f0911a06c0cc","resolution":{"observed_at":"2026-05-26T13:07:48.019733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efficient and memory-efficient tuning for vision transformer: a disentangled approach","venue":null,"work_id":"121a16ff-cbd7-4a02-8a96-fb7e5eb8e093","year":2024},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:20983fad90c3397c9643ccd2fbb0ba5af2e5c23c21c35ae7751391658fac14e1","observation_id":"d9b176f5-756b-48a5-ab48-ed1f55ab409f","resolution":{"observed_at":"2026-05-26T13:07:48.058973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPIN: Sparsifying and integrating internal neurons in large language models for text classification","venue":null,"work_id":"e5e4462f-2983-4681-a19d-f2857cc065d6","year":2024},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:977359155e71fc86bbeb16de5a7e9bb3f6a51a06467183878496d9c9d616222b","observation_id":"0c59dd77-a11a-4f25-a87b-fc74b0b0aa16","resolution":{"observed_at":"2026-05-26T13:07:48.045573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18519","last_updated":"2026-04-20T17:17:07Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:17:07Z","title":"LLM Safety From Within: Detecting Harmful Content with Internal Representations","version":1},"cited_work":{"arxiv_id":"2604.18519","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18519","snapshot_observed_at":"2026-06-30T21:35:04.761308Z","title":"LLM Safety From Within: Detecting Harmful Content with Internal Representations","venue":"cs.AI","work_id":"4ea0944a-8b8a-4722-a0f1-08c7293f8e4c","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2604.18519","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:2c7103ceac9a0a7103b81eacc16d6590a565524a2031b15e90f130dfab460a9d","observation_id":"85e0dbd5-f316-43eb-a156-6af8652f9f7f","resolution":{"observed_at":"2026-05-11T19:06:10.607800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","venue":null,"work_id":"923ca0dc-a8bc-42ff-94c3-cb0036d918c1","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:59fb03c70e6c19a22c04f54e6c313a48d8d7bfd7140bdbcb162125308d824246","observation_id":"cae10cba-748b-49ea-aa5c-0859c201015d","resolution":{"observed_at":"2026-05-26T13:07:48.064845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":"5c5002b7-0c91-47d8-910a-58aad11fb534","year":2019},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:8e72866f7fd5a79c3a48a0dc8d72896e278135318faffb71d25a6a2ea3191a90","observation_id":"2a3a2e76-12f4-4460-8a38-1ac05f3bc343","resolution":{"observed_at":"2026-05-26T13:07:48.014306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:35:34.404348Z","title":"Vidore benchmark v2: Raising the bar for visual retrieval","venue":null,"work_id":"150178f5-a7c1-4213-aa52-c524dfc02964","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:c843bffbf28c3074fae460b7f454f77605a8fe1039ddfa475740281503e5a18c","observation_id":"ee942beb-4920-48c3-91e3-391dca4426db","resolution":{"observed_at":"2026-05-11T19:06:10.633306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08620","last_updated":"2026-04-21T12:44:21Z","snapshot_observed_at":"2026-08-02T18:48:56.645709Z","submitted_at":"2026-01-13T15:00:33Z","title":"ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2601.08620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.08620","snapshot_observed_at":"2026-07-03T14:08:22.480354Z","title":"ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios","venue":"cs.AI","work_id":"bcf10626-2101-4d09-ac3b-d4184fb81303","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2601.08620","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:a2c9bfe4fceb75df43f37f8fd7970cd9fccdcbd30619affc45a7eb455964c1c2","observation_id":"6e9f785d-a7b4-487c-8c30-41dbf2678dfb","resolution":{"observed_at":"2026-05-11T19:06:10.624346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMDocIR: Benchmarking multimodal retrieval for long documents","venue":null,"work_id":"f85b7bba-65db-4650-b338-7217b72a8972","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:94df3236ac636cc4cd5f3d029a357155d8fd0443fde5126773658f21b2a50825","observation_id":"0fa20434-17c7-40c1-bdc0-d38219fd7208","resolution":{"observed_at":"2026-05-26T13:07:48.016663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-05T22:10:04.039940Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"cited_work":{"arxiv_id":"2508.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07493","snapshot_observed_at":"2026-07-08T20:35:34.394180Z","title":"VisR-Bench: An empirical study on visual retrieval- augmented generation for multilingual long document understanding.ArXiv preprint, abs/2508.07493","venue":"cs.CV","work_id":"9698a654-f27a-42a3-a870-d0d500daaada","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2508.07493","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:4d3e4c37dffb875808fec5b988a6b7b9c3847d7621dee4d6bd5b140ddb0902de","observation_id":"e0b5a8c2-a50f-4d35-8fd4-0f029e609d28","resolution":{"observed_at":"2026-05-11T19:06:10.643227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducibility, replicability, and insights into visual document retrieval with late interaction","venue":null,"work_id":"b9ebc4ff-744f-4031-83af-f4583cbcba1d","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:60115e07053d9232b3e2c9b04bc0f7d59253e29cd9151fc83b91bdf184fcce81","observation_id":"e86a0f5b-1bf2-4657-8c20-b4aeb28e8a24","resolution":{"observed_at":"2026-05-26T13:07:48.032563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained late-interaction multi-modal retrieval for retrieval augmented visual question answering","venue":null,"work_id":"a3f385b0-53c6-401d-877b-847a5d1579fd","year":2023},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:6fbbb0d7c9cb9ff2c3685391b7a473bc5352b0f3b95bd0c477b50c8663a38f23","observation_id":"16b7248c-5f4e-401c-b9ee-30af9ccb3083","resolution":{"observed_at":"2026-05-26T13:07:48.043078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eager embed v1: Multimodal dense embeddings for retrieval","venue":null,"work_id":"896680a2-51f4-449c-bf30-11a146f5a795","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:b1985d0bc9d09d266b40cdcfcad45ef02a447349cd7edd4da1623ddd3d0f6c77","observation_id":"d311d56e-3222-4553-a9d1-6d2df0e9102c","resolution":{"observed_at":"2026-05-26T13:07:48.038119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating multi-layer representations for dense passage retrieval","venue":null,"work_id":"4041d83b-7a8c-4b37-9a92-4d5744f21f70","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:9dd5c6529536f2cc0be33102f8eabcfde9b2a5f2d6f2c46c0e0f91aa5bc681c9","observation_id":"a735328e-7234-4fa5-b445-8b921d56cbcc","resolution":{"observed_at":"2026-05-26T13:07:48.067596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:4202f383b8a126d4f2ef704a04d76842bd43ed41cc77c4e8bd19e5a4184efd66","observation_id":"4d7edc2b-ef31-4c3e-b2c7-0e5a977e11f5","resolution":{"observed_at":"2026-05-11T19:06:10.555032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:a299589a065590886d0ae49750cd6403ea89ff0f6e6017226084813cf8daf70a","observation_id":"033d49f1-62d3-4ebf-9ab3-68b7d9941a7f","resolution":{"observed_at":"2026-05-11T19:06:10.600681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regression shrinkage and selection via the lasso.Journal of the Royal Statistical Society: Series B (Methodological), 58(1):267–288, 01 1996","venue":null,"work_id":"f99881bf-0657-439a-b25e-d5c266017fda","year":1996},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:f53644fad0c7c08aae14d90ea10b421165f375719878f8ac9237d7fe66e6c527","observation_id":"5f283085-22f1-4440-bdb4-82956a5613b0","resolution":{"observed_at":"2026-05-26T13:07:48.025435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guided query refine- ment: Multimodal hybrid retrieval with test-time optimization","venue":null,"work_id":"c6132293-6bef-44d0-b669-6fdcfa0aff43","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:6cba46a939f3a58e17ad3fa6b108bb081e06a62d97fc12397d4963e5c300859b","observation_id":"2ababb76-457b-4563-9076-23595ba31248","resolution":{"observed_at":"2026-05-26T13:07:48.070230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cumulated gain-based evaluation of IR techniques","venue":null,"work_id":"2d09589c-bcbb-4de4-8d44-a6853b99eeaa","year":2002},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:9bb45e422938e2795317043029c2ac5616bae7529d464482650f1a22befb19bc","observation_id":"a1eb0210-d2d5-4b96-85b4-c208863b6016","resolution":{"observed_at":"2026-05-26T13:07:48.022505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:36:29.521451Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"139a920c-85a1-42e5-937e-f14d907436d5","year":2019},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:f80c7f71314f0e95b3376648ccb857602a3cb322834eb9ece8cea9ce0454aea8","observation_id":"0b1410b6-fa12-4ca8-9eb7-51fe6ca33638","resolution":{"observed_at":"2026-05-26T13:07:48.027901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"95cb6e30-6496-40f8-b389-21fa89f5d466","year":2023},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:bd702cb54f5148d82ed24b003f79b00b32655da4234e3806de26c1169e5379a0","observation_id":"e8b25ded-698b-45bb-ae56-ee49ed0f5477","resolution":{"observed_at":"2026-05-26T13:07:48.053095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLM2Vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"9c4cc1b2-9b1f-42aa-9162-3d4b78350428","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:ff7dde18ca6611ece750c1a3f2e01df863e691582c58404d4424639933920553","observation_id":"650bd11a-5b5d-4e3e-8614-3385312b442a","resolution":{"observed_at":"2026-05-26T13:07:48.007708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qdrant: Vector similarity search engine and vector database","venue":null,"work_id":"66a35464-e271-4795-8228-f1ddb6d65dbe","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:7707fec02a4c2dbac6463786bb76b2313cc01559e3de72e5fb376b92a8eba22f","observation_id":"bf0c0a53-37cd-48d8-8ec5-4694c4ca566f","resolution":{"observed_at":"2026-05-26T13:07:48.073622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":"2601.04720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-07-08T20:35:34.399203Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","venue":"cs.CL","work_id":"eb6d74de-e0e8-47b8-ac29-ca460a55fac5","year":2026},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:ee509151cf64f46be1558e5675f506a32e3f87753bb19f0dbf93e8877c67fdd2","observation_id":"b3f66d4b-07c3-4387-aa62-fcb3ef1fe88f","resolution":{"observed_at":"2026-05-12T09:36:21.368649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":28},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2605.06460."}