{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30be5cf26631df4b3b78e1dfaac1b6c7dec3704b1bd30198fa799de56f145d37","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:17:04.441743Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24530/citation-record","integrity":"/paper/2605.24530/integrity","json":"/paper/2605.24530/citation-record.json","paper":"/paper/2605.24530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.400392Z","title":null,"venue":null,"work_id":"4735de2d-fb95-4ef8-810d-5b712746851b","year":2013},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:fa2e4984366d621c7db5d8052073bea215514a8cd27ee8fd48d1c256cc124306","observation_id":"f228981d-552f-43db-be47-256f40c5c6f1","resolution":{"observed_at":"2026-07-09T02:45:54.401458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":"2411.06176","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-06-30T20:55:04.595521Z","title":"Jacob Cohen","venue":null,"work_id":"17ea30ae-ef9f-446c-83c0-fb5af024e4aa","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:7e8ccc3b3724be02f012131906bb63ffaee2c2249c36ebe1d97d925d2a14b093","observation_id":"0421510b-a2e7-4512-aae5-f860ae6eb48e","resolution":{"observed_at":"2026-06-30T13:24:40.427435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":"2411.04952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-07-04T12:09:48.864251Z","title":"M3docrag: Multi-modal retrieval is what you need for multi-page multi-document understanding","venue":null,"work_id":"776da489-7ed1-484b-a0a8-4c975ba75e98","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:69aa6125c0afd74a5b4495dbfaa993d1d02f2b5a92e9ee341b7dc9ec2e0a7fea","observation_id":"d8dc2758-9de4-4ab9-8eea-c2ddd260589f","resolution":{"observed_at":"2026-06-30T13:24:40.430081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":"2009.09941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-07-04T16:39:57.607479Z","title":"Pp-ocr: A practical ultra lightweight ocr system","venue":null,"work_id":"555e4547-6e8f-49f5-acf4-0adae9b359e3","year":2009},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:efc86de0f895e8171e9e641d6484d749099dd0331cf4757a09f0dba7c8bcc8a5","observation_id":"1c60580d-06ad-4b1c-b5e1-fd1105fb5a10","resolution":{"observed_at":"2026-06-30T13:24:40.422205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":"2407.01449","doi":"10.48550/arxiv.2407.01449","metadata_source":"pith","pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","venue":"cs.IR","work_id":"d2468d08-90dc-4690-887a-9b10a6d3574e","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:3bf13bfabdffe6200d933131aa36591db587c79ad89987f9493737aec7a5027a","observation_id":"745db614-9bf2-4b9c-b993-e4c4dc602a88","resolution":{"observed_at":"2026-06-30T13:24:40.419835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.379726Z","title":null,"venue":null,"work_id":"382d4cfa-821a-4d78-8588-d61f7ab7cdc9","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:17ffd88ee833d8d8cf6c45fb97b53151f6f08fef2caef9c5c47d885c8f8cfc0f","observation_id":"8a13a4df-e971-423a-8dc4-2d575a493686","resolution":{"observed_at":"2026-07-09T02:45:54.380811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-06T15:58:29.524516Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":"2409.03420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-06-30T13:24:40.403192Z","title":"mplug- docowl2: High-resolution compressing for ocr-free multi-page document understanding","venue":null,"work_id":"cbccb6f4-58a1-47da-92a9-fe746db74363","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:af3417ce30fefa67d0169c18032b0724d3706836e668446ff8b7281d16dd7caa","observation_id":"b3fde4fd-881b-4d17-bee6-89b7105f20b6","resolution":{"observed_at":"2026-06-30T13:24:40.404764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.374719Z","title":null,"venue":null,"work_id":"f73f2aad-643b-4eb7-a6d6-f2f2fc4cd1fc","year":2017},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:77eb1469e4691956c75ccf86e485fcdc0d72b1e3621fb7fb10752c02296d4b48","observation_id":"c6670ae7-d4e4-4c64-b090-3e117de1aa0a","resolution":{"observed_at":"2026-07-09T02:45:54.375850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":"2004.04906","doi":"10.48550/arxiv.2004.04906","metadata_source":"pith","pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","venue":"cs.CL","work_id":"3d6f2008-b001-4542-ba3f-192f6880c74b","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:139723595bd80583dd2136771d35aea8eee0ddfef6faab97a831f4cfe4816612","observation_id":"b48d440e-caf0-49a9-b8a1-c271b1113a69","resolution":{"observed_at":"2026-06-30T13:24:40.401287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.388144Z","title":null,"venue":null,"work_id":"2797ad24-4e78-45ab-84e3-6228ef1d5d82","year":2019},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:446f656c34230be5d14b1ca44030ae016de6092ac21881a0e971e80754bc2c61","observation_id":"33f6e1aa-e498-46c6-aab8-2f9e68b86ca5","resolution":{"observed_at":"2026-07-09T02:45:54.389189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.413596Z","title":null,"venue":null,"work_id":"3e873b77-4e10-4fec-97aa-79ec51a35e26","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9b1ea38ca34644b903f2c0e882fefccf2966cb341de2d07cb7a3620c34491e2e","observation_id":"d17761c4-e4f8-4898-a841-6a340139e82d","resolution":{"observed_at":"2026-07-09T02:45:54.414637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.02729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:24:40.405444Z","title":"arXiv preprint arXiv:2410.02729 , year=","venue":null,"work_id":"983937bd-9818-4522-8378-7ad8394c35d4","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:a1a97f9133178757aeeb8394fd7d5ada9da26fbeb4da6360c641b6480e7d0cd5","observation_id":"82630bb3-6c79-4a51-8f6c-701e07c834b5","resolution":{"observed_at":"2026-06-30T13:24:40.406932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.376417Z","title":null,"venue":null,"work_id":"96e59739-e3b9-4d5e-8c91-e419d82a82ba","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:7e83a0441cd328ef1d7405fb6b3e5ed4e229aef9b1cfd9a543d18e3e7032d746","observation_id":"7df60d71-5278-4143-9eee-0b56558ef79a","resolution":{"observed_at":"2026-07-09T02:45:54.377514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2411.02571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-07-04T15:49:57.631122Z","title":"arXiv preprint arXiv:2411.02571 , year=","venue":null,"work_id":"da61907d-fb9d-4f7b-a9bc-4750420fb05e","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:66f4056c3c85cbf2e245f5b8f465e51885df60ea59c247dcf4393da701ee9cdc","observation_id":"68e3f404-c0df-4047-b61b-98556488ebec","resolution":{"observed_at":"2026-06-30T13:24:40.415138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-05T00:28:25.127698Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:787d1b1b8e2832b2879d878fb90113bd4d9a115c1fc693ff7de25c7992510f1c","observation_id":"61a2e927-ece4-4e15-b5d4-550b9650d052","resolution":{"observed_at":"2026-06-30T13:24:40.417608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.416714Z","title":null,"venue":null,"work_id":"4aca20f6-3ca1-4859-9999-42fc94933ed0","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:e556a1cc7ddb8e436d90456832e4c3c8c005ff7da39b63b7174190589b69088d","observation_id":"10c81f66-d17d-453c-b2c9-76faf1f7a57a","resolution":{"observed_at":"2026-07-09T02:45:54.417764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.391371Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":"1a3d1811-995d-40a6-92d5-341c79ae6118","year":2022},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:578d7ad8354357e542286176c23e18cd536e1aa9da81cb1f84364eaa2d8a390f","observation_id":"d85ca3cc-a82c-4f6a-8255-69940a832060","resolution":{"observed_at":"2026-07-09T02:45:54.392383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.392873Z","title":null,"venue":null,"work_id":"6d86c239-8a9b-4da3-bb5c-3cc50e068ec4","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:37902021901c70aa2ee8a760fafb61f4656cd93c89e3af80cdd5a7d8cf38e1e2","observation_id":"25788001-6456-41b7-aebb-488162488ca7","resolution":{"observed_at":"2026-07-09T02:45:54.393913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.383165Z","title":"InIEEE/CVF Winter Confer- ence on Applications of Computer Vision (WACV), pages 2582–2591","venue":null,"work_id":"0dacf0ef-22ca-45bb-acd2-df394cf0d71a","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:1749401b8d1c3090c508a412de3ac6ac55adbcf8b1ea06abbdbc7b9c4dd01492","observation_id":"3af315b7-e945-48bf-b023-50d7ce390d65","resolution":{"observed_at":"2026-07-09T02:45:54.384413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.378079Z","title":"Khapra, and Pratyush Kumar","venue":null,"work_id":"6498e30e-9776-47a2-8598-05d2c7832ede","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:fcb27adc8777e7ad1772c0894f2b27217df8f6c9dda74ebbfad5c8d6e3eb629f","observation_id":"5a4b87a6-5054-464c-92d2-0269986eac7d","resolution":{"observed_at":"2026-07-09T02:45:54.379172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.403839Z","title":null,"venue":null,"work_id":"bc8e89c1-127d-40a1-b553-9f6e3ffdedac","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:0755c8c0e0f70e50532e26e0f09c49bee76aa6116d88878fb52dac955d4a2e65","observation_id":"99746474-7af8-45c8-9030-a55ef4bdd982","resolution":{"observed_at":"2026-07-09T02:45:54.404911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07899","last_updated":"2021-12-15T05:33:27Z","snapshot_observed_at":"2026-07-06T12:18:53.315820Z","submitted_at":"2021-12-15T05:33:27Z","title":"Large Dual Encoders Are Generalizable Retrievers","version":1},"cited_work":{"arxiv_id":"2112.07899","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.07899","snapshot_observed_at":"2026-07-04T10:19:47.681833Z","title":"arXiv preprint arXiv:2112.07899 (2021)","venue":null,"work_id":"b37eec54-1bc5-434b-bad4-aa468c3dd463","year":2021},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2112.07899","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:7bc7c2be2040abe6872a4bd86b974a65d65da59f3ecd0b56b7e6287596f661f7","observation_id":"83b255a5-9e5b-4f92-8604-13d724d73d89","resolution":{"observed_at":"2026-06-30T13:24:40.428706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.407023Z","title":null,"venue":null,"work_id":"dfa7059b-a44a-484f-9d4c-c807237241cc","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:6a5e4fb640767561ae2924245b96d3962c59c1f545a176d6bd0ebef6425a73c6","observation_id":"ef306ca8-0c0d-4a12-9753-6cb1830603d4","resolution":{"observed_at":"2026-07-09T02:45:54.408135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:e729968c4b11427628f294b9ae91c3aebdc485f4f121c5d5864948a7b1242554","observation_id":"3c39645e-889c-4f90-8f3e-12257e8cfdd6","resolution":{"observed_at":"2026-06-30T13:24:40.421028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.384965Z","title":null,"venue":null,"work_id":"5abda5e2-6401-4d53-a9bf-fd5965147b13","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:bf0972c5555e0335a053357fc573bc3e727f158af0537a2b9233be4dee1d10e5","observation_id":"51a286e1-3e60-43c8-87d6-18c9b43bc634","resolution":{"observed_at":"2026-07-09T02:45:54.386013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.398702Z","title":null,"venue":null,"work_id":"528e280f-6941-4f4a-8f15-ad56dbc4fe5b","year":2009},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:ecb848c896dcacb2ea978c1d5a32271cd51c3208a5d0f4d1dac6b1c6efec54b3","observation_id":"39907396-c232-4d0a-b203-3447fc22584d","resolution":{"observed_at":"2026-07-09T02:45:54.399820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.394507Z","title":null,"venue":null,"work_id":"d7efd3d5-e368-4946-8729-d709ccce8848","year":2022},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:25758f709e83612bef73ff36ac80bcc0a25204b11a5cf531372664d801cc29df","observation_id":"a0e98b3e-d9ba-491d-baed-06b4c7e08260","resolution":{"observed_at":"2026-07-09T02:45:54.395634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.198691Z","title":null,"venue":null,"work_id":"c69dcc4d-85af-4249-accc-cbae1a0e230c","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:5781bc01e8bd4e6fd1cecc9c5389abc62a4f78195a427a428cb943e83adecbea","observation_id":"552810d6-1436-4c86-be18-738b3f1cc662","resolution":{"observed_at":"2026-07-09T02:45:54.398080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.410593Z","title":null,"venue":null,"work_id":"0184f45e-ed59-4dbc-b89d-9027f4e610ac","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:6c612d5f77415cd7aa74fb699dc2ca54aff1b983208dbf0c70156d40db02a133","observation_id":"1dea2f51-09c6-4355-9786-fe3284da9a3c","resolution":{"observed_at":"2026-07-09T02:45:54.411555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.389748Z","title":null,"venue":null,"work_id":"9fa09794-f13e-4a09-8cfe-a301890dcd1e","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9c5a8d86a52f43664b0a7df11efe78bf32b98910db1336db5c7f9fe1867ee1d3","observation_id":"a0f87eb0-b489-4d12-87d4-44462c7651ab","resolution":{"observed_at":"2026-07-09T02:45:54.390848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.412029Z","title":null,"venue":null,"work_id":"29df1b4c-db72-4e87-a5c8-66e1b016c648","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:110bbfb9e48384ea67d7796183bdd2c89953f0ac323599aa27bba8299d300083","observation_id":"bf0090f8-53a9-4a4a-8421-4ab1a6c14fef","resolution":{"observed_at":"2026-07-09T02:45:54.413072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:736e2d49cb81082ed8bce25d80c05f171bd700ca774938d5540e3c4c4badea9d","observation_id":"9727d19d-a926-498e-a04d-794fdac67262","resolution":{"observed_at":"2026-06-30T13:24:40.426165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.386509Z","title":null,"venue":null,"work_id":"4ac01260-e03f-4975-9f97-d04f0916058c","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:3d8b849b83d4e0bd3703561694941ae7ac13feeca10660cc1cdac42efff7cb62","observation_id":"7d3385b0-e45d-4ea6-9fbb-68313de9170c","resolution":{"observed_at":"2026-07-09T02:45:54.387597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:790d2569fe542dc4bc96a7fe9c4f0e01c08aaf2f46d6619e4174f854db7d4a90","observation_id":"b4e1f398-2588-4c40-831e-c044ad26a43f","resolution":{"observed_at":"2026-06-30T13:24:40.407370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":"2307.02499","doi":"10.48550/arxiv.2307.02499","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":"arXiv (Cornell University)","work_id":"990d95b3-f658-488d-b1a6-169e9e6aa7fb","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:cd471793f8cc8e04e43b9d7866b7f6f5910bde6b638becfbcaebcd06cb2f341d","observation_id":"e9aa1bb3-8649-49e7-a2b6-482da0b6da85","resolution":{"observed_at":"2026-06-30T13:24:40.416164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":"2410.10594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-07-03T05:57:41.459329Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","venue":"cs.IR","work_id":"91acd90a-d182-4502-a92c-390a77f29b81","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9c78a0130a7b9d4f39c1f5383037455b508da3236bb40d0d385cdf6c6b90ef3e","observation_id":"c4d40835-a550-4a93-8a3c-f1b6da9bf5dc","resolution":{"observed_at":"2026-06-30T13:24:40.409288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.381363Z","title":null,"venue":null,"work_id":"ae90b087-d92f-4779-bf00-e8a5e597bb5f","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:ea37a4642cfcedaed2c8b1b5a7567e93517ba68e5dc4b0047ef86dd33d38e1af","observation_id":"9e160308-3cb8-4215-926b-558979229cec","resolution":{"observed_at":"2026-07-09T02:45:54.382608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"cited_work":{"arxiv_id":"2410.21169","doi":"10.48550/arxiv.2410.21169","metadata_source":"pith","pith_arxiv_id":"2410.21169","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","venue":"cs.MM","work_id":"1237b74e-e94a-4846-a4ae-3960929fd6aa","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2410.21169","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:8ac21d823a47fbdbfd8403ce3d9a25a58e8f6a210cf183a01be92f40352ebbc9","observation_id":"ae15918d-4136-40d1-899a-85fb31c1fb6b","resolution":{"observed_at":"2026-06-30T13:24:40.418711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:e8e12365344595eca7217ef8da692812fe332dbd78f94ce2d0ecb46fd4f26e19","observation_id":"0ce5236c-ea7f-4cb5-88f4-1e587a8e86e5","resolution":{"observed_at":"2026-06-30T13:24:40.423530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.408704Z","title":"Settings ArXivQA ChartQA MP-DocVQA InfoVQA PlotQA SlideVQA","venue":null,"work_id":"225bdc99-01dd-4d07-a06b-129444035930","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:587d3655bc719a0aeb44e620fcbea473cd5d20c5da12cbf5a99b05f0d2e802e2","observation_id":"863643e8-1659-4e99-aeb8-278392045eed","resolution":{"observed_at":"2026-07-09T02:45:54.410068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.372764Z","title":"B Training Details Training DataIn web page retrieval, we utilize 49,095 training pairs of query and positive documents","venue":null,"work_id":"12dc45b8-7bc9-46c7-9fed-a7e1b86b64d1","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:7565e8e570afe9298ce866f658149bc72e8c733e07bfc16de9551816d62865c0","observation_id":"5f2e8822-3a18-411e-a5f8-2fadf501a7a0","resolution":{"observed_at":"2026-07-09T02:45:54.374132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.415144Z","title":null,"venue":null,"work_id":"19c8f24a-032c-48a3-be26-c59c80422371","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:557bad565eb889458902f7acc8a8ce8423459fe2faf7cc4bc1498abb499e0f94","observation_id":"21699fde-8414-4aee-a02e-58ab230b7f31","resolution":{"observed_at":"2026-07-09T02:45:54.416162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.405436Z","title":null,"venue":null,"work_id":"da115657-2dce-4c63-ada0-0e4d882511ac","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:fb7bcfae9a6a86358ff5b7794dafd6b751a6c6edc7b9d8d60756a7d74ce47101","observation_id":"a510f0fa-23ad-4ab7-b5e9-21adeedc5888","resolution":{"observed_at":"2026-07-09T02:45:54.406488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.402011Z","title":"Only results with confidence scores above 0.6 are retained, and the bounding box coordinates, along with the recognized text, are stored for further processing","venue":null,"work_id":"b87d1da3-1aff-4e99-a1a9-19c0843fa66a","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:dfa43bb344847c129de377e5692faa37fad8d48b97b2812dab4600ef22aff115","observation_id":"b6e09a7f-7a79-487a-8acf-8361e63e6c41","resolution":{"observed_at":"2026-07-09T02:45:54.403296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":17,"verified_fuzzy":6},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.24530."}