{"as_of":"2026-08-14T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:822bc7ffcb3c6f17510adf79ad37f42189a081df14112858b1ce3398b4bc4e19","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:42:14.915935Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T21:55:02.656863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T21:59:06.400938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"cited_work":{"arxiv_id":"2412.08746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08746","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVLM: Make your VLM an efficient reader.arXiv preprint arXiv:2412.08746","venue":null,"work_id":"4c82febf-153d-4d8f-9778-a5e759736f65","year":null},"citing_paper":{"arxiv_id":"2605.18818","last_updated":"2026-05-12T13:07:34Z","snapshot_observed_at":"2026-08-12T04:06:08.744040Z","submitted_at":"2026-05-12T13:07:34Z","title":"Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T21:55:02.656863Z"},"links":{"cited_paper":"/paper/2412.08746","citing_paper":"/paper/2605.18818"},"observation_digest":"sha256:8cdd665ff6ed72d199987cda96706f3e837fcdbcf92aff7f49873cced3ef37e3","observation_id":"83f55883-6cbf-4800-a317-78e8c3ccad98","resolution":{"observed_at":"2026-05-20T21:59:06.404665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08746/citation-record","integrity":"/paper/2412.08746/integrity","json":"/paper/2412.08746/citation-record.json","paper":"/paper/2412.08746"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.841910Z","title":"Sequence-to-sequence contrastive learning for text recogni- tion","venue":null,"work_id":"cd9a5679-92f8-4628-8789-06089b0788cd","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.660000Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:cb387d6e0ad65cf3fd3f4e922002184ce42fb5de0ffddcecf48de4a2b5b8ea02","observation_id":"0d95e635-eb90-46bc-8478-43366a9a697e","resolution":{"observed_at":"2026-08-11T17:42:15.847032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03873","last_updated":"2022-05-08T13:55:30Z","snapshot_observed_at":"2026-08-13T15:48:11.933897Z","submitted_at":"2022-05-08T13:55:30Z","title":"Multimodal Semi-Supervised Learning for Text Recognition","version":1},"cited_work":{"arxiv_id":"2205.03873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.03873","snapshot_observed_at":"2026-08-11T17:42:15.282856Z","title":"Multimodal Semi-Supervised Learning for Text Recognition","venue":"cs.CV","work_id":"94ee0079-8be8-4c41-afb7-873b5b40b3f0","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.664037Z"},"links":{"cited_paper":"/paper/2205.03873","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:5df5dac2f2e40b55f040ccdaf145a1f1b4bee1ceb321b804d0a02034861d5005","observation_id":"ce335f3e-c1c6-4b33-a514-a18942a47dd9","resolution":{"observed_at":"2026-08-11T17:42:15.286747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.827790Z","title":"Clipter: Looking at the bigger picture in scene text recogni- tion","venue":null,"work_id":"262ad2d2-548e-4d3d-b95d-b88315205a04","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.667866Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:81de52d8109ef96d8813570fd8cc1ab91a50efd9cb9235d7661d1a1e12ea5018","observation_id":"a83da128-c292-4c5a-82f0-a0123d3c23a5","resolution":{"observed_at":"2026-08-11T17:42:15.832160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.816075Z","title":"Visfocus: Prompt- guided vision encoders for ocr-free dense document under- standing","venue":null,"work_id":"a082a959-5f39-4f89-b2a2-9f1af4bf0c0b","year":2025},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.671218Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:455a8fae81a79dc4de0f8621e5783eb28c05d26117f33faa19a2aa2d8a8ec0d8","observation_id":"97adfa2a-0880-4d59-84bf-f52aa06e0634","resolution":{"observed_at":"2026-08-11T17:42:15.819896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.674632Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.674632Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b4d8b51520dc6877ec9f015ba090594d3f34b338fc4d7265fc0e5d8bde25a2e0","observation_id":"0dbb5cf3-6f5c-4557-bb3e-4aa26e03ea85","resolution":{"observed_at":"2026-08-11T17:42:14.674632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.794366Z","title":"Docformer: End-to-end transformer for document understanding","venue":null,"work_id":"88fd7943-ca7b-4957-b61b-52774cd3a5e3","year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.678011Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:db8d421d255b577eed1f5757aa8fbd6943ed95e0b97b402be38feee1955bbb51","observation_id":"abc368ed-db23-432e-b4c8-6a799a689b42","resolution":{"observed_at":"2026-08-11T17:42:15.801855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.771650Z","title":"Docformerv2: Local features for document understanding","venue":null,"work_id":"2db5dadf-8f8c-4e76-a076-dd610004f3db","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.681409Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:c473b9190170bc683d8c2186b8b83aaf7ea9b37d1e42060d72f926220b947dfc","observation_id":"33997b18-557c-491d-bfe4-53f9caf214f8","resolution":{"observed_at":"2026-08-11T17:42:15.777421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04615","last_updated":"2024-07-04T07:08:15Z","snapshot_observed_at":"2026-08-13T04:24:33.133428Z","submitted_at":"2024-02-07T06:42:33Z","title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04615","snapshot_observed_at":"2026-08-11T17:42:14.684571Z","title":"Screenai: A vision-language model for ui and infographics understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.684571Z"},"links":{"cited_paper":"/paper/2402.04615","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:e837b29d785b1d4d4301be8d2c98e38a8688294bc8ec5a9ef47c72300a9b3fdf","observation_id":"603ac7e8-1290-4fd2-acee-b26cfdd395dd","resolution":{"observed_at":"2026-08-11T17:42:14.684571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:42:14.688335Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.688335Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:11913ea841e30bbd3dbd37e76d285c8548a81c68d96d506fd25b665eb6786154","observation_id":"86291faa-31e1-4997-9aed-7da95e13ebe8","resolution":{"observed_at":"2026-08-11T17:42:14.688335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T17:42:14.691914Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.691914Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:265c57db888748b2348226c12f981018175e47c9f320a5d7d65f979895c533ed","observation_id":"b4053255-729c-4b5c-9baa-ecd98b1ba15f","resolution":{"observed_at":"2026-08-11T17:42:14.691914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.758142Z","title":"Scene text visual question answering","venue":null,"work_id":"2ea2d146-2314-434d-b5ef-fb614e3618f6","year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.695774Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:1938633f7252bf4a3b71596e2f96cec7cb57b0c4f47f7f50eb3a753c89e11352","observation_id":"6e5bfb32-75f0-4d42-90f3-71b82931c738","resolution":{"observed_at":"2026-08-11T17:42:15.761696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.734430Z","title":"Latr: Layout-aware transformer for scene-text vqa","venue":null,"work_id":"a0dd2592-333e-4d40-86c8-85d75b534098","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.699038Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:96d03fdeeb5b229ede5f99d95fa82d73d6425f527aa18f518117c4fadabd949d","observation_id":"680bee12-b608-4c91-9c1a-8a1c292b6423","resolution":{"observed_at":"2026-08-11T17:42:15.739553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12985","last_updated":"2022-02-25T21:30:48Z","snapshot_observed_at":"2026-08-13T16:33:55.739399Z","submitted_at":"2022-02-25T21:30:48Z","title":"OCR-IDL: OCR Annotations for Industry Document Library Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12985","snapshot_observed_at":"2026-08-11T17:42:14.702449Z","title":"Ocr-idl: Ocr annota- tions for industry document library dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.702449Z"},"links":{"cited_paper":"/paper/2202.12985","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:07cfafa2cbb5bf7e9936b207fa14a57769b7804e6c446e210330dfb15b926bae","observation_id":"a19bad3c-e51f-4dd0-8e1b-9e85c7880300","resolution":{"observed_at":"2026-08-11T17:42:14.702449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.706094Z","title":"Gram: Global reasoning for multi-page vqa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.706094Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:6813df66380491739f1f0998b7d75e071884fd3d5750520be053058a0a37789d","observation_id":"4b3582b1-5aba-429e-9051-a6e8b13c226c","resolution":{"observed_at":"2026-08-11T17:42:14.706094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T17:42:14.709581Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.709581Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:ef746df0086cd053051110184278b7169ef5b9916cd529dc6a9b478a273e64d0","observation_id":"263231ec-21af-428e-bcf0-b8591b249bcc","resolution":{"observed_at":"2026-08-11T17:42:14.709581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-11T17:42:14.713185Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.713185Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:13dff14026a13fa1ab6312f2f2defa93a3eb721fb979196f2b373436090c7393","observation_id":"70b2f9db-b7f6-457e-9d1f-2638aeb6eebb","resolution":{"observed_at":"2026-08-11T17:42:14.713185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-13T05:49:44.454749Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T17:42:14.716518Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.716518Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:893590f34590ca23dd4aad0aaff694ecbcc22b9bd27b58a80802d614600e3be9","observation_id":"0db02ade-4d5c-4fc9-80c0-dd8a8cc24eb9","resolution":{"observed_at":"2026-08-11T17:42:14.716518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.720325Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.720325Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:75f10f92fe58b59c834a2f2eced45bc015d720e538c70a377d92fbe356c21e8d","observation_id":"3809b3e9-1c73-4ba8-b5c8-1daba241f17c","resolution":{"observed_at":"2026-08-11T17:42:14.720325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T17:42:14.723706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.723706Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b6d4279696facf22b99b11bccecc218ed6edaae21f60635129056a85b40c5bb8","observation_id":"e34e2c5d-740a-430a-bb97-3b315914d230","resolution":{"observed_at":"2026-08-11T17:42:14.723706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-13T17:48:34.710025Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T17:42:14.727112Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.727112Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:cc74457199bf3ec599e232e71fd8eed96e3e195817f1e4274ee00bd778ac31f5","observation_id":"a8a84652-7a5b-4304-b070-6d2d8702753e","resolution":{"observed_at":"2026-08-11T17:42:14.727112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.696286Z","title":"Dtrocr: Decoder-only transformer for op- tical character recognition","venue":null,"work_id":"af75c58f-f892-4285-a138-502827500fda","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.730476Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:8b0b22df68b21816d78eb04c31ff11c0790caaed19f2585af936766e5ce4e3e2","observation_id":"5d08ab50-a9f8-47a5-a6ea-1497d6abc638","resolution":{"observed_at":"2026-08-11T17:42:15.700195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.673192Z","title":"Towards models that can see and read","venue":null,"work_id":"6bbae7c4-0937-41d7-817d-22c47fd0efe0","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.733829Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:913a128162397ff4c130d5be33b42ed662be5d2bfda4f735a2c69b5a51c62afc","observation_id":"8e22a9ff-be1b-49c4-b305-6c5d0c8262c3","resolution":{"observed_at":"2026-08-11T17:42:15.676824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.657756Z","title":"Question aware vision transformer for multimodal reasoning","venue":null,"work_id":"c456aa41-01bc-4e6b-9290-ccb95b8dff77","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.737048Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:aacd583147432bd4396df447009460ef933058955b2e20dee788beccad2da547","observation_id":"bb305f88-a348-4121-8b18-6bdf6dbe89d1","resolution":{"observed_at":"2026-08-11T17:42:15.661519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.644957Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"15c178ed-df67-4b21-9eed-0274dd39ac4b","year":2017},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.740285Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:80769c507d25a94049b896fe89bb904a665b24602cbe3d819303aedd3fe38c46","observation_id":"420b070a-ff4b-4341-bc40-f9ab7456889e","resolution":{"observed_at":"2026-08-11T17:42:15.649027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.632629Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"c310a761-22c0-40a4-8d5d-422955811c88","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.743453Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:e184011d8bc22c8f8faebfbbd1db8b27884270aa27cc18a37c921657b20c0fa4","observation_id":"74329bad-5407-48c5-8423-7176f78b40f2","resolution":{"observed_at":"2026-08-11T17:42:15.637499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08255","last_updated":"2024-06-12T14:28:25Z","snapshot_observed_at":"2026-08-12T23:44:31.294299Z","submitted_at":"2024-06-12T14:28:25Z","title":"M3T: A New Benchmark Dataset for Multi-Modal Document-Level Machine Translation","version":1},"cited_work":{"arxiv_id":"2406.08255","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08255","snapshot_observed_at":"2026-08-11T17:42:15.154684Z","title":"M3T: A New Benchmark Dataset for Multi-Modal Document-Level Machine Translation","venue":"cs.CL","work_id":"4c7d8196-da1c-4c3b-8388-0735809348f2","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.748106Z"},"links":{"cited_paper":"/paper/2406.08255","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:0e52801b6fcb0a8c8d00830112e5aedb4c1730ff9531372006c8999d7d2f5ff9","observation_id":"c256a160-35cd-4c4f-85dc-b43b8871cd0f","resolution":{"observed_at":"2026-08-11T17:42:15.161999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-12T22:50:50.231608Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-11T17:42:14.751688Z","title":"mplug-docowl2: High-resolution compressing for ocr- free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.751688Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:71c80b60f2de2de1356d04b823916858bc8b04114cf016602c69750095316cc8","observation_id":"06682577-5388-4b29-b7fa-a806ecdc8dc3","resolution":{"observed_at":"2026-08-11T17:42:14.751688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.622143Z","title":"Towards unified scene text spotting based on sequence generation","venue":null,"work_id":"2a0480e9-a96b-40ee-8f7d-ba54fc19ec21","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.755209Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:45527af3c2ef00388667675a9cebbd735d54aabce57ae9c757dce8cc772ac44e","observation_id":"33ef0390-6e67-4dfa-9864-6e3c4f3dac4d","resolution":{"observed_at":"2026-08-11T17:42:15.625573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-13T17:24:28.063798Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-11T17:42:14.758608Z","title":"Donut: Docu- ment understanding transformer without ocr","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.758608Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9e0b8e4a86b64dcc026ec490064dc621b6dad517beb5232e35b8e048989baffb","observation_id":"e2e9d1b4-b0b2-40de-981a-93cbddac54b1","resolution":{"observed_at":"2026-08-11T17:42:14.758608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-13T00:15:14.556734Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T17:42:14.762029Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.762029Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:71f320758e95261fbacd5bb5024090e81fea00bf1ab1aede9f5e304655ddeded","observation_id":"7185aa3e-4c12-40d5-a219-ce5e089d5ed4","resolution":{"observed_at":"2026-08-11T17:42:14.762029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T17:42:14.765303Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.765303Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7aef03324ec3f729bb500f13339350d02d03947abfb427fe3193184a127f4f27","observation_id":"cccefa27-388d-4548-a17e-43f726d64b16","resolution":{"observed_at":"2026-08-11T17:42:14.765303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.768805Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.768805Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:f51394c98182e0028a55a673253b18380380308c4e6696430b914a1beba72839","observation_id":"808b0bc4-6e05-4254-bdce-04d498a0186a","resolution":{"observed_at":"2026-08-11T17:42:14.768805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T17:42:14.772001Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.772001Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7476b83097276e7ad889f035390f43271bd5bb4123573ca14842c43f81167783","observation_id":"a0873528-fedb-49f4-88f7-8c9689af5dca","resolution":{"observed_at":"2026-08-11T17:42:14.772001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.595823Z","title":"Scatter: selective con- text attentional scene text recognizer","venue":null,"work_id":"5df2aef0-1478-4b6b-b5c8-f10857e8f49c","year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.778183Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:8f3536d5105239ff77c77a9c1157cd485478fdba3ad1541bd1d080c99e77d12b","observation_id":"a1cb8b79-8268-4011-8271-c5f017051d93","resolution":{"observed_at":"2026-08-11T17:42:15.601849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.781530Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.781530Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:63e2ca29cf868f4b82a706b2bdb29ffd9ad5d0b7eae27ddb6f8c82a4ac83f887","observation_id":"9fdad15d-55ce-4431-9fe5-4d0bf66f134d","resolution":{"observed_at":"2026-08-11T17:42:14.781530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.784614Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.784614Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:76e28ba95f0ce872e37948180e64e6bb133e0bd750fe1e3caa3e952fea8b1664","observation_id":"b9272f10-53a6-48da-b75c-b78946a74760","resolution":{"observed_at":"2026-08-11T17:42:14.784614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.562442Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"e5b1f8cd-d931-4209-b50a-e37ecf24ae85","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.789406Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7ecf7e98c8f41aba9341c65a44a1d0ad6a0037e3ab273c1762be2325c3855cbe","observation_id":"dd5f3872-6ef9-4f77-8e34-ccbb466a6e86","resolution":{"observed_at":"2026-08-11T17:42:15.569569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T17:42:14.792528Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.792528Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:753e9d03108d635decb2099f4a42cc23044af780e674d5513a3ebeed29cb6e67","observation_id":"4be20eb9-54f9-4a2e-8cb7-53b5e0f58641","resolution":{"observed_at":"2026-08-11T17:42:14.792528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.547307Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"26d3ebb9-7d39-4d96-980e-431278eef71d","year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.796956Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:60b23fec6cee01a1b04d93475db178e5fcc62110dcd1ff8838eaedf450feb88e","observation_id":"83b1b8fb-4943-4c57-931b-5ba6817448e9","resolution":{"observed_at":"2026-08-11T17:42:15.553179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.513293Z","title":"Infographicvqa","venue":null,"work_id":"15d8c7a8-c421-4348-a157-8c663f4d69fc","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.801218Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b8814e060477d8a93a27d7141f63dede21c1406e48a5823f059a4ea65115469c","observation_id":"49244a03-65ff-401b-8ff1-1f842a332346","resolution":{"observed_at":"2026-08-11T17:42:15.534751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.804446Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.804446Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:40af89f4ae9682056eeef04bb9c5f5f0a21dea150f6461f48843b94e6fab55eb","observation_id":"19674d70-1e3f-49a8-88e9-4b1ee35b7cd7","resolution":{"observed_at":"2026-08-11T17:42:14.804446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.483131Z","title":"Textadain: Paying attention to shortcut learning in text recognizers","venue":null,"work_id":"157f8307-d8f3-47c5-abdf-16fa635a814f","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.807710Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:a8fdf8cb10300e025c07d85997c585dc676560f40545b5fe48e20d123365fcb7","observation_id":"aec45507-a783-4669-86b1-4295e6e6e4fd","resolution":{"observed_at":"2026-08-11T17:42:15.493123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T17:42:14.810883Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.810883Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9ef59e17ee74e992e8f08f617182f62c3ee0cd6d9711bbc655f0070f19b2e9ce","observation_id":"eca49a30-8850-46bd-a733-9f620a43f6f5","resolution":{"observed_at":"2026-08-11T17:42:14.810883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.814493Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.814493Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:705937717c981871f1ced8b4cc87aebac3c2620b233f027f74ad762d74473308","observation_id":"a1acf826-880f-4844-87cb-0403900ba6dd","resolution":{"observed_at":"2026-08-11T17:42:14.814493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03364","last_updated":"2022-08-05T19:14:43Z","snapshot_observed_at":"2026-08-13T14:49:53.357534Z","submitted_at":"2022-08-05T19:14:43Z","title":"GLASS: Global to Local Attention for Scene-Text Spotting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03364","snapshot_observed_at":"2026-08-11T17:42:14.818997Z","title":"Glass: Global to local attention for scene-text spotting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.818997Z"},"links":{"cited_paper":"/paper/2208.03364","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:cc9481c36660c9f44994140fe8632ecfecdafe17ce4e2da3d735efc59ee192cc","observation_id":"b4c32e6e-f4a5-4dfa-b566-d7031b1c6888","resolution":{"observed_at":"2026-08-11T17:42:14.818997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.822578Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.822578Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b425a47452e41e91079f8a2e1884f6de897111c8a1cb3218b3078e50c2ddca2e","observation_id":"22912a0c-9d61-4879-b8fe-13698debcdd3","resolution":{"observed_at":"2026-08-11T17:42:14.822578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.434746Z","title":"Towards vqa models that can read","venue":null,"work_id":"06d4de09-f582-484a-b92b-61b40a979fb0","year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.826725Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:42859cd03bb1a39dd94b0afb86a42a65c8372290e4c07c92770e66e9bca40759","observation_id":"3d30a0a9-8f37-44cb-99c9-20d469c48152","resolution":{"observed_at":"2026-08-11T17:42:15.438395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.398104Z","title":"Instructdoc: A dataset for zero-shot gener- alization of visual document understanding with instructions","venue":null,"work_id":"feb8c649-7959-40e8-b742-b18dc5009971","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.832432Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:bfcaa8fbee0d181934a702ac17ce7d32563fa8373abe0d74c8c7e88f587dfea3","observation_id":"e2a6e898-08b5-4869-b4ea-79fc57b94d29","resolution":{"observed_at":"2026-08-11T17:42:15.421608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.383729Z","title":"Hi- erarchical multimodal transformers for multipage docvqa","venue":null,"work_id":"8d13bea6-6817-400e-8e41-9dc956ba3f4a","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.836449Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:e3660d69a44d10e3fa42797e7f8c6dfc9357fd2f31154d5591267d713ed0f34c","observation_id":"4fc6056f-ba81-4d87-9163-bd3fbb4aa3c4","resolution":{"observed_at":"2026-08-11T17:42:15.391807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.365738Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"59514c77-f982-4e7e-95d2-5f58ab4836d5","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.850835Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:caa6ca936b74668f7ec9119f65430977ad76267fc9dabe0a3c950bbc064c5ca2","observation_id":"f2f38ca2-8ee0-429e-a95b-d9d29bfbb79a","resolution":{"observed_at":"2026-08-11T17:42:15.370799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00908","last_updated":"2023-12-31T22:37:52Z","snapshot_observed_at":"2026-08-13T04:50:40.422288Z","submitted_at":"2023-12-31T22:37:52Z","title":"DocLLM: A layout-aware generative language model for multimodal document understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00908","snapshot_observed_at":"2026-08-11T17:42:14.858346Z","title":"Docllm: A layout-aware genera- tive language model for multimodal document understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.858346Z"},"links":{"cited_paper":"/paper/2401.00908","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:42723c9ef3106fcde4c12e2cbe2f7c574fbb9199721480e4b63b8752a50d706c","observation_id":"8a1ab35e-680a-4395-8b0d-539f5af5fb83","resolution":{"observed_at":"2026-08-11T17:42:14.858346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T17:42:14.862395Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.862395Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:982e65a6434363a68fedd930af845a20088dcd55610a49fb5f02db54c0397701","observation_id":"c6e054a9-6d96-4299-8b1f-da5b50f2d127","resolution":{"observed_at":"2026-08-11T17:42:14.862395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00526","last_updated":"2023-09-07T08:40:16Z","snapshot_observed_at":"2026-08-13T11:27:29.740387Z","submitted_at":"2023-06-01T10:28:12Z","title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00526","snapshot_observed_at":"2026-08-11T17:42:14.867758Z","title":"Layout and task aware instruction prompt for zero-shot document image question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.867758Z"},"links":{"cited_paper":"/paper/2306.00526","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:89dce53cf0d03b57f193b255dd9d89f7cffd6e7fa9ae48e913f9a495a92c220b","observation_id":"c96d11ff-42d2-4c2a-9ca8-414d0cfd81f1","resolution":{"observed_at":"2026-08-11T17:42:14.867758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.355338Z","title":"Layoutlm: Pre-training of text and layout for document image understanding","venue":null,"work_id":"355e71a1-90c4-42f4-9974-92291916589a","year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.873685Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:886f83f05539f4a85097ff5895bdf8cb2491f59da99b1b056ac18a0e1e44b332","observation_id":"b02716ba-9456-4415-9e20-88f23408f67f","resolution":{"observed_at":"2026-08-11T17:42:15.359252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-13T05:54:33.801989Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T17:42:14.877803Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.877803Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:8352bc985d2ed2f2da30927eef0505e76dd5870ba1f51fe09c64da80d804d93f","observation_id":"9f687888-e6cb-4ea7-8640-113138fd9b41","resolution":{"observed_at":"2026-08-11T17:42:14.877803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.343470Z","title":"Dptext-detr: Towards better scene text detection with dynamic points in transformer","venue":null,"work_id":"f9b3b1cb-f683-4c0b-b405-a8e272c5b3c4","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.881568Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:2b3e8eea8b32591f561bfc7c862815c1d0e74bdc372e15b03e41ee7a5345241a","observation_id":"c9cca9cb-c68d-4cc0-8bb8-54592e6afc9e","resolution":{"observed_at":"2026-08-11T17:42:15.347097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.326171Z","title":"Deepsolo: Let transformer decoder with explicit points solo for text spot- ting","venue":null,"work_id":"f5f76914-c4a5-4e46-aba3-4643a2aebdec","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.888590Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:3cff5ad588d549a7aef2d82eb668f5ff16d805298dfffb9d3b71ecfdc9eb9b51","observation_id":"a6f9ff17-c632-449a-b020-fb0fb9f84129","resolution":{"observed_at":"2026-08-11T17:42:15.331773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T17:42:14.892017Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.892017Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:72e8780fce4d79a791dc8c71ad965b728273706639d7ddf30aff0e0298c86e32","observation_id":"4d194bfd-b861-4324-b4ef-628cc0342fc5","resolution":{"observed_at":"2026-08-11T17:42:14.892017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-11T17:42:14.897792Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.897792Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:4f6039526ba82072d1468d5293fc4a4b829241e2b582c2151b9d762100f85990","observation_id":"381c7c14-7bc2-468b-adad-b45847ef488a","resolution":{"observed_at":"2026-08-11T17:42:14.897792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T17:42:14.901281Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.901281Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:c35dc7669af999659a5f40e3b088b30176e5ef2f925ead2138861b16b4af0b59","observation_id":"f3afa750-7b12-474b-ae8e-56f25805e8af","resolution":{"observed_at":"2026-08-11T17:42:14.901281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.315169Z","title":"Towards complex doc- ument understanding by discrete reasoning","venue":null,"work_id":"066cb9f2-e82f-4406-8baa-e37c33ef7aca","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.905475Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9f9be6cf5d876e9e24e1f6c51144adbba723d14a5e47055d7b8649ce3337f3ec","observation_id":"23c2e6cd-2f15-4de5-b2ee-35443e785d9d","resolution":{"observed_at":"2026-08-11T17:42:15.318670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.293850Z","title":"The encoder is initial- ized with pretrained weights from DocFormerV2, which was pretrained on the Industry Document Library (IDL) dataset [13]","venue":null,"work_id":"e3f7cf2a-c1fb-4677-850a-4247153de413","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.915935Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:c509b1aff19c6050bcf1da2fc4f38cdb59791f0f0485618be2f36986054564f9","observation_id":"c79542d8-7131-404a-813b-9090a688b5c9","resolution":{"observed_at":"2026-08-11T17:42:15.302121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:05:18.225502Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2412.08746."}