{"as_of":"2026-08-22T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52d5c7d4dfd0562315dc7feab5f93a772e6ca153abb84b876608fd6868478aa8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:54:30.078700Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T20:35:34.389743Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-08-17T02:26:12.770175Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:19:43.882232Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2410.05160"},"observation_digest":"sha256:7dfe9fe5c49b145940a0c541de4528382811c31d62f1bd69f18f1e0fbb1f52b8","observation_id":"c0a8c74e-3b6a-4a59-b860-720164b12216","resolution":{"observed_at":"2026-05-17T21:19:44.003434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-13T17:45:25.269133Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:46c82ea99c17d7e4398f854bf86ccd0cd12893dddd1b317c687920be48b50f60","observation_id":"ee7345cb-6457-452b-8d99-139940b2767b","resolution":{"observed_at":"2026-05-16T15:37:25.914858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-10T22:17:27.878444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.878444Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:1777cd45dd103f24ca487914fc4b862624f02cfca1e19c0d10191e83a9d4c0b0","observation_id":"52ff63e4-f94b-4245-9fff-2ff617cce2dc","resolution":{"observed_at":"2026-08-10T22:17:27.878444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-15T20:54:30.078700Z","title":"arXiv preprint arXiv:2406.11251 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11651","last_updated":"2025-05-21T17:26:12Z","snapshot_observed_at":"2026-08-18T14:01:58.478059Z","submitted_at":"2025-05-16T19:22:19Z","title":"MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:54:30.078700Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2505.11651"},"observation_digest":"sha256:72132c5bf2ca234b79191b47c46198a047d2a7957b2f1ecba69ea041511565a4","observation_id":"ddbb6ba8-2596-4272-ad8a-bc4bc0c14887","resolution":{"observed_at":"2026-08-15T20:54:30.078700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-07T13:08:54.715670Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22584","last_updated":"2025-05-28T16:56:41Z","snapshot_observed_at":"2026-08-13T01:49:52.632752Z","submitted_at":"2025-05-28T16:56:41Z","title":"DocReRank: Single-Page Hard Negative Query Generation for Training Multi-Modal RAG Rerankers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:54.715670Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2505.22584"},"observation_digest":"sha256:2aef3922c9d0a48d2a1a060b32abf16f07784769c9548744e63ff00513e8348c","observation_id":"34bee540-80c6-443c-8c28-4cfe1de2c402","resolution":{"observed_at":"2026-08-07T13:08:54.715670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-07T12:35:38.087216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24782","last_updated":"2025-06-06T16:42:11Z","snapshot_observed_at":"2026-08-21T19:36:33.704297Z","submitted_at":"2025-05-30T16:43:28Z","title":"Context is Gold to find the Gold Passage: Evaluating and Training Contextual Document Embeddings","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.087216Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2505.24782"},"observation_digest":"sha256:d40d20e30e147b6ab42d0fa8a67bd57bc4b8f3ec85ce0e6b91098c2d16c78bff","observation_id":"c9498298-07a1-4917-9acb-0a3c6fc677da","resolution":{"observed_at":"2026-08-07T12:35:38.087216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-07T00:57:02.852824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12364","last_updated":"2025-06-22T13:42:54Z","snapshot_observed_at":"2026-08-13T00:36:54.872271Z","submitted_at":"2025-06-14T05:55:00Z","title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:02.852824Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2506.12364"},"observation_digest":"sha256:d46f26471a92a594ab892bda36735092b6e4b8ab3639066adaa1292489bd6ed0","observation_id":"f1ee92c4-9e5a-47d5-aa40-e5628d48190b","resolution":{"observed_at":"2026-08-07T00:57:02.852824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-06T15:57:03.049531Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-17T21:12:15.287539Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:03.049531Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:71bf9f0b3eab8d3acd31c4400b9e352b531e63c13e00eefe4cb27a92455e3d26","observation_id":"12aa11bf-4c35-4687-8124-4d932a64a8bf","resolution":{"observed_at":"2026-08-06T15:57:03.049531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-05T22:10:08.163447Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-19T03:33:04.948769Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.163447Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:f7a80ce46edce2dd2f35d85d7620a77b23b3f1cc49a2effcd85804ecd26c900f","observation_id":"8e2e274e-6fc6-4b8d-b793-bdaac0a7bc63","resolution":{"observed_at":"2026-08-05T22:10:08.163447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2601.21262","last_updated":"2026-04-16T06:59:30Z","snapshot_observed_at":"2026-08-11T08:05:18.804557Z","submitted_at":"2026-01-29T04:47:27Z","title":"CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T10:14:15.589472Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2601.21262"},"observation_digest":"sha256:ad923b05e095b1c7ab11f68c6127982aac9bd3b1908c6328ff4e250724c77d48","observation_id":"6c075382-8f53-4aca-af63-26429245d348","resolution":{"observed_at":"2026-05-16T10:17:44.667001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-03T04:20:55.730245Z","title":"Unifying multimodal retrieval via document screenshot embedding.arXiv preprint arXiv:2406.11251, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.730245Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:8d45a9ac35d60f9caff508c1a1e70775ab7360472db2eb39c615f7c6cacde60c","observation_id":"58ad22d6-b653-4236-9404-83176f58b5ae","resolution":{"observed_at":"2026-08-03T04:20:55.730245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-03T03:30:18.920992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29897","last_updated":"2026-05-24T03:07:49Z","snapshot_observed_at":"2026-08-13T20:26:54.434746Z","submitted_at":"2026-02-08T12:39:19Z","title":"UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:30:18.920992Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2603.29897"},"observation_digest":"sha256:ec391e72371602555559c64cc2b934cd159928b1f10ade5b69ef8e4697957e2f","observation_id":"dc5dfa3c-7e2e-4a50-a259-76316b58efe9","resolution":{"observed_at":"2026-08-03T03:30:18.920992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2604.07079","last_updated":"2026-04-08T13:35:09Z","snapshot_observed_at":"2026-08-13T23:25:14.297094Z","submitted_at":"2026-04-08T13:35:09Z","title":"MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:51:16.675856Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2604.07079"},"observation_digest":"sha256:f84a2fe33ba0f70e646713719983b2a6f8933b26156ac415ff35c9aa0409eb8c","observation_id":"9d64daca-7ed4-473c-9939-efbbead07a87","resolution":{"observed_at":"2026-05-11T06:00:58.257323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2604.07201","last_updated":"2026-04-08T15:28:21Z","snapshot_observed_at":"2026-08-13T01:38:15.603876Z","submitted_at":"2026-04-08T15:28:21Z","title":"BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:28:59.838565Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2604.07201"},"observation_digest":"sha256:79ed8934394a8d670d9cffa27f99f11ddde68dfcea0d252212f1e7f90b2b8150","observation_id":"1ebebf6e-4a94-4a38-ae5d-354e7e95c0ab","resolution":{"observed_at":"2026-05-11T06:41:57.258511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-12T03:56:50.822754Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:937e049cfe7740b6ced09caaa0eb10e22350991d266bcc0646bc9b15da1c732c","observation_id":"61a2e927-ece4-4e15-b5d4-550b9650d052","resolution":{"observed_at":"2026-06-30T13:24:40.417608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2605.30027","last_updated":"2026-05-28T14:50:53Z","snapshot_observed_at":"2026-08-06T11:47:39.586448Z","submitted_at":"2026-05-28T14:50:53Z","title":"DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:09:41.068000Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2605.30027"},"observation_digest":"sha256:1920f4e412714fd018c3c2741425be247eba9b276842b091bdaf116d98a59156","observation_id":"113d6025-1d2b-45fe-8ee0-40e2765d67c2","resolution":{"observed_at":"2026-06-29T08:13:15.122467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2607.05927","last_updated":"2026-07-07T07:31:05Z","snapshot_observed_at":"2026-08-18T09:52:32.743493Z","submitted_at":"2026-07-07T07:31:05Z","title":"CMDR: Contextual Multimodal Document Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T20:30:59.126121Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2607.05927"},"observation_digest":"sha256:fe642d883e2da71665a47bd0cf7731beb021a585045cb0f160a3c3e865f38ae2","observation_id":"1491a0ee-69d4-4915-84df-6cdec3795c12","resolution":{"observed_at":"2026-07-08T20:35:34.390920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11251/citation-record","integrity":"/paper/2406.11251/integrity","json":"/paper/2406.11251/citation-record.json","paper":"/paper/2406.11251"},"outbound":[],"paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-20T14:50:13.861019Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2406.11251."}