{"as_of":"2026-08-11T06:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24e7f88ab7f4e510dfbd413a97d11f44898ff001ba76f44cb1dd144ed8733d6f","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:51:48.175750Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:44:49.894408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-16T22:21:18.877497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"cited_work":{"arxiv_id":"2509.24621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.24621","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FreeRet: MLLMs as Training-Free Retrievers","venue":"cs.CV","work_id":"4951e842-5d5a-401e-9512-9b0759bb1b1f","year":2025},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2509.24621","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:d95e9063f2c108452b1f5b3d678654d1ef14de4429f35312c352e8dbd0215c10","observation_id":"a24e8ce2-005e-45c7-aa2b-16511eac61f2","resolution":{"observed_at":"2026-05-16T22:21:18.879203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24621","snapshot_observed_at":"2026-08-02T00:44:49.894408Z","title":"Freeret: Mllms as training-free retrievers, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.894408Z"},"links":{"cited_paper":"/paper/2509.24621","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:cf25058044947674d872d6861b1e4e8e2361c85198d4b0a314f9af7bea691b16","observation_id":"16bcb70a-b636-4490-9e5d-1904c9346190","resolution":{"observed_at":"2026-08-02T00:44:49.894408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.24621/citation-record","integrity":"/paper/2509.24621/integrity","json":"/paper/2509.24621/citation-record.json","paper":"/paper/2509.24621"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T13:51:43.859969Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:43.859969Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:ca506e4bd911288298ce4e14257713ee78ee7825ef67b9a23b425a52d557bce7","observation_id":"4cd1bd75-29ad-4a32-8c27-50a4a634ee09","resolution":{"observed_at":"2026-08-04T13:51:43.859969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-04T13:51:44.906899Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.906899Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:5d514705644b61e7f6e0f1f846b8fe01c716b4a76ce92ca42b120975ca9c33fb","observation_id":"8c7d23bc-7776-4f42-8dcf-3d7edd7c68be","resolution":{"observed_at":"2026-08-04T13:51:44.906899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T13:51:45.017918Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval.arXiv preprint arXiv:2505.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.017918Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:4d0b07480a566aa4b56de85b7d2275693d04b3a35a25e9303b51bd61ee896279","observation_id":"53c0bd72-bc9e-42d9-87d1-38ee6fc94016","resolution":{"observed_at":"2026-08-04T13:51:45.017918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:45.134226Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning.arXiv preprint arXiv:2503.04812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.134226Z"},"links":{"citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:ec208b3efd4ef4a940b8f8c66f382dddccb7e0ccf9889cbb3612d46d580352d4","observation_id":"d6390c5b-ccb4-4480-815f-a73ce239e35a","resolution":{"observed_at":"2026-08-04T13:51:45.134226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18458","last_updated":"2024-07-22T09:35:08Z","snapshot_observed_at":"2026-08-06T16:30:59.315642Z","submitted_at":"2024-02-28T16:35:52Z","title":"Meta-Task Prompting Elicits Embeddings from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18458","snapshot_observed_at":"2026-08-04T13:51:45.243145Z","title":"Meta-task prompting elicits embeddings from large language models.arXiv preprint arXiv:2402.18458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.243145Z"},"links":{"cited_paper":"/paper/2402.18458","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:f8d6ff2dd2760cde46111915c466cd9ea4c6546fba3a62bfbb17846877c6253c","observation_id":"0e1d7afa-ed1c-4a16-9b7a-f31d127d8c52","resolution":{"observed_at":"2026-08-04T13:51:45.243145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T13:51:45.405402Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.405402Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:45d6e1a93667de84d50e7e6b9c0285215e510478f2cc02837f36815dcb7c5bbd","observation_id":"98be9408-7cbe-4b49-a090-bce47863e48a","resolution":{"observed_at":"2026-08-04T13:51:45.405402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-08-10T16:59:36.795964Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-04T13:51:45.593825Z","title":"Your mixture-of-experts llm is secretly an embedding model for free","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.593825Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:e9690026eb49e234a1c6fa63de7d28f6b30b35d670f271c20f89ba1dfca8868d","observation_id":"26fba614-591f-48ed-8ef3-7fa053f843ee","resolution":{"observed_at":"2026-08-04T13:51:45.593825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-10T17:21:48.259020Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-04T13:51:45.715775Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms.arXiv preprint arXiv:2411.02571,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.715775Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:a883db14ef4f67e452f5fe42d5180654091338823c73aa6978110f1fa8d586cd","observation_id":"b9d4bee7-5631-4a32-8c17-ee87f78270b7","resolution":{"observed_at":"2026-08-04T13:51:45.715775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00954","last_updated":"2025-04-01T16:47:20Z","snapshot_observed_at":"2026-08-07T16:16:57.345878Z","submitted_at":"2025-04-01T16:47:20Z","title":"IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00954","snapshot_observed_at":"2026-08-04T13:51:45.837477Z","title":"Idmr: Towards instance-driven precise visual correspondence in multimodal retrieval.arXiv preprint arXiv:2504.00954, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.837477Z"},"links":{"cited_paper":"/paper/2504.00954","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:f5722f2e5d00ce7108faca2ee3006d58800db109834f66afd17da46c7d15ebfb","observation_id":"331d8613-da27-4bc8-9de0-a339b1e35f7e","resolution":{"observed_at":"2026-08-04T13:51:45.837477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-06T18:26:57.432317Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08064","snapshot_observed_at":"2026-08-04T13:51:46.051954Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.051954Z"},"links":{"cited_paper":"/paper/2507.08064","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:f10b80e5fc614fc05f6015158b79f3bf995aa6aaeed38d2316a9e0fb34351f45","observation_id":"2c283fa7-683b-44cf-b708-c95e3bc8b952","resolution":{"observed_at":"2026-08-04T13:51:46.051954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-08T15:48:31.665148Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-04T13:51:46.190342Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents.arXiv preprint arXiv:2507.04590,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.190342Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:85f8f5c9945e2b66efdec95af220d982c237a1f95c6b3a7b1656bc183c9a1d72","observation_id":"99bbb62d-bba3-49db-a400-10abc6f28b64","resolution":{"observed_at":"2026-08-04T13:51:46.190342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00329","last_updated":"2025-08-20T19:09:06Z","snapshot_observed_at":"2026-08-09T13:44:56.206327Z","submitted_at":"2025-03-01T03:29:02Z","title":"ABC: Achieving Better Control of Multimodal Embeddings using VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00329","snapshot_observed_at":"2026-08-04T13:51:46.300749Z","title":"Abc: Achieving better control of multimodal embeddings using vlms.arXiv preprint arXiv:2503.00329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.300749Z"},"links":{"cited_paper":"/paper/2503.00329","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:8aeced3a505b2559f5a46bf23829c1f0084a5191fc40612ddbd37857d4069c88","observation_id":"bfb23136-d37a-4820-86c5-b3cd861dac8b","resolution":{"observed_at":"2026-08-04T13:51:46.300749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09136","last_updated":"2026-04-01T15:51:06Z","snapshot_observed_at":"2026-08-07T12:36:27.102579Z","submitted_at":"2025-01-15T20:40:25Z","title":"Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09136","snapshot_observed_at":"2026-08-04T13:51:46.487847Z","title":"Agentic retrieval-augmented generation: A survey on agentic rag.arXiv preprint arXiv:2501.09136,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.487847Z"},"links":{"cited_paper":"/paper/2501.09136","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:2e05436e074f1bb56a2e7c87f6d9c2fc5c115d943c96b26e92728182b5d8b387","observation_id":"fadf603e-6e5a-49cb-b848-29bb5654fa24","resolution":{"observed_at":"2026-08-04T13:51:46.487847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-08T06:06:41.534202Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-04T13:51:46.748960Z","title":"Rep- etition improves language model embeddings.arXiv preprint arXiv:2402.15449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.748960Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:854a3646c0db4cf7c29cc49afff20438acfb47ad690f36d5667078a8d0b9a1e3","observation_id":"a8716cb6-480b-48bb-ae76-b9d70901cb20","resolution":{"observed_at":"2026-08-04T13:51:46.748960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T13:51:46.961197Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.961197Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:1a47f2736e84bcb1afd77065f9fe4cbfe03b267a43c0ac31f28a9548a9ab0900","observation_id":"917f7d0a-cc6d-4d83-a965-69ea11d1b269","resolution":{"observed_at":"2026-08-04T13:51:46.961197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14635","last_updated":"2025-02-09T16:40:16Z","snapshot_observed_at":"2026-08-10T22:42:33.696591Z","submitted_at":"2024-10-18T17:36:53Z","title":"GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14635","snapshot_observed_at":"2026-08-04T13:51:47.066669Z","title":"Geneol: Harnessing the generative power of llms for training-free sentence embeddings.arXiv preprint arXiv:2410.14635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.066669Z"},"links":{"cited_paper":"/paper/2410.14635","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:57bbd06aab5fb97937b8d77c96dc6e0a7e31b51d8e7b6bea7ad3b6365979da7a","observation_id":"0bade4ad-4e8a-4c62-b53f-eca4b9a6df2b","resolution":{"observed_at":"2026-08-04T13:51:47.066669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T13:51:47.410013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.410013Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:c26dcd46729590ebdd0b3283b12f72f280556a93dc60aef9b0b41f643519a770","observation_id":"90df73cf-6061-4400-807e-e75bd64ae71f","resolution":{"observed_at":"2026-08-04T13:51:47.410013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19900","last_updated":"2025-03-25T17:57:17Z","snapshot_observed_at":"2026-08-07T16:37:36.089033Z","submitted_at":"2025-03-25T17:57:17Z","title":"CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19900","snapshot_observed_at":"2026-08-04T13:51:47.574156Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning.arXiv preprint arXiv:2503.19900,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.574156Z"},"links":{"cited_paper":"/paper/2503.19900","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:318957b37defc163893e9c774a2e9cb418f100be1f805ac84a68df0fe072df38","observation_id":"8b1ae8c2-680d-4d1b-b0d2-8cf5074c2f69","resolution":{"observed_at":"2026-08-04T13:51:47.574156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-04T13:51:47.730305Z","title":"Simple techniques for enhancing sentence embed- dings in generative language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.730305Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:f2fc9f4b1caa7a67312688a304852e96b8a2af55c68a57c565b856db948e7f6c","observation_id":"70403970-c00e-475d-81aa-ec3fa4377d6e","resolution":{"observed_at":"2026-08-04T13:51:47.730305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:47.807060Z","title":"Guiding cross-modal represen- tations with mllm priors via preference alignment.arXiv preprint arXiv:2506.06970,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.807060Z"},"links":{"citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:ebfd26681b17394475bfd4875e9a15f35a68913c0a2d99655bec16b6b041b4e6","observation_id":"49f655dc-7e36-47b8-9731-419e8a38a5ce","resolution":{"observed_at":"2026-08-04T13:51:47.807060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-04T13:51:47.927031Z","title":"Megapairs: Massive data synthesis for universal multimodal retrieval.arXiv preprint arXiv:2412.14475,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.927031Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:aa38fe133f443ea9736bb84b155c7250dd7a7b5aaaab48bbb25149e266c356d9","observation_id":"bbf44705-8aec-4727-975c-e52fb73c1668","resolution":{"observed_at":"2026-08-04T13:51:47.927031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T13:51:48.060652Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.060652Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:00a0c839b58e1cc54a5c609300c1d3a59f199164ae0bd938ea326dfb734c6434","observation_id":"544ab897-e1ad-4293-9bc8-97d4de8e7ca5","resolution":{"observed_at":"2026-08-04T13:51:48.060652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:48.175750Z","title":"Reply only with ‘Yes’ or ‘No’","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:48.175750Z"},"links":{"citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:bf8e4441e21012aa67f0952cf88e306c6b19097c60e3164a2551b6c3a04bac37","observation_id":"e34eae24-0db7-4b14-956d-bd1bd47e9cc8","resolution":{"observed_at":"2026-08-04T13:51:48.175750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-09T01:49:29.596087Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-04T13:51:44.103590Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data.arXiv preprint arXiv:2502.08468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.103590Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:f9833e00449abcd23bda8d1feeabf940d0bad2a3bf254ab82df9e29ca587130d","observation_id":"7800cf64-9e88-4bfe-8760-d704bfa0cde8","resolution":{"observed_at":"2026-08-04T13:51:44.103590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11556","last_updated":"2025-07-03T06:24:49Z","snapshot_observed_at":"2026-08-06T14:11:16.070516Z","submitted_at":"2024-12-16T08:42:00Z","title":"Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11556","snapshot_observed_at":"2026-08-04T13:51:44.359594Z","title":"Token prepending: A training-free approach for eliciting better sentence embeddings from llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.359594Z"},"links":{"cited_paper":"/paper/2412.11556","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:55dc4292dbdff26d6e37cfd78109eb28db9390665008f3e54cc567b6c18e32a3","observation_id":"255c323b-f667-4d5a-9ada-2c6cf0d17b70","resolution":{"observed_at":"2026-08-04T13:51:44.359594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T13:51:47.222387Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.222387Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:3884ca855b3215a0eb8a47aba25e578c85a87d875d85d51b824e8a9061b95a1b","observation_id":"db38e351-0130-4a4e-b987-7e9619bb7c80","resolution":{"observed_at":"2026-08-04T13:51:47.222387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-01T09:03:35.501236Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-04T13:51:44.769800Z","title":"Scaling sentence embeddings with large language models.arXiv preprint arXiv:2307.16645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.769800Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:7d6c3d879b1e6b10d9f6d974ccd1379e685f70799a1aba6da0766b69436fedc6","observation_id":"0c58442a-7344-4c20-834a-a54508027b37","resolution":{"observed_at":"2026-08-04T13:51:44.769800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10471","last_updated":"2025-04-14T17:54:28Z","snapshot_observed_at":"2026-08-07T16:05:46.948703Z","submitted_at":"2025-04-14T17:54:28Z","title":"MIEB: Massive Image Embedding Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10471","snapshot_observed_at":"2026-08-04T13:51:47.306583Z","title":"Mieb: Massive image embedding benchmark.arXiv preprint arXiv:2504.10471,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:47.306583Z"},"links":{"cited_paper":"/paper/2504.10471","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:104ce38ed2277d254a69d375cf5de8c63f2e50053d5c73573e616dc64823be20","observation_id":"1005f206-1afe-437d-84d6-da0b33b01268","resolution":{"observed_at":"2026-08-04T13:51:47.306583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T13:51:43.963065Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:43.963065Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:8942234ef9858009b298abce27545e77876ab52117c46607ce0aeb26f92d39f3","observation_id":"9a9c248f-2f8c-4930-9554-b1f8988f838b","resolution":{"observed_at":"2026-08-04T13:51:43.963065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:51:44.618861Z","title":"Breaking the modality barrier: Universal em- bedding learning with multimodal llms.arXiv preprint arXiv:2504.17432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.618861Z"},"links":{"citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:e395cf1a4cfc7f4dfb30b9ab0106910cc72a89e1524d99b2ba8ef76ac2935c39","observation_id":"d7d1b244-391c-4b06-b716-aec09917d6f1","resolution":{"observed_at":"2026-08-04T13:51:44.618861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-04T13:51:44.489689Z","title":"Retrieval-augmented generation for large language models: A survey.arXiv preprint arXiv:2312.10997, 2(1),","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.489689Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:1adb7e98a655e7cfe67c73a16ebb1c6e2ee87dd3e5711d126cacafa2151b1384","observation_id":"fcc43ec4-cbb2-4f65-8bc0-a8c1e1d99ce5","resolution":{"observed_at":"2026-08-04T13:51:44.489689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T13:51:44.206465Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.206465Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:6e57bd565392e0001848eb5195043b47756f059f70b2ef50d0da4ea08162e4f9","observation_id":"f1f08b03-5330-4c86-b60f-c1888a4036b9","resolution":{"observed_at":"2026-08-04T13:51:44.206465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2509.24621."}