{"as_of":"2026-08-20T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7b9bf8413d67e40e89b6c623620a1c08a4fe40c54ea50191eda886a51a2214b","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:51:41.504443Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18327/citation-record","integrity":"/paper/2412.18327/integrity","json":"/paper/2412.18327/citation-record.json","paper":"/paper/2412.18327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.732685Z","title":"Textcaps: a dataset for image captioning with reading compre- hension,","venue":null,"work_id":"54a1810c-f2dc-40d7-a405-87e500d18054","year":2020},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.431664Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:aeac73ef2db64f7c6183b6c9b3fd25fa4e4f1157eba9027d044d07c29aeb0221","observation_id":"b13f1780-b852-4c66-81f7-29c62b1203d3","resolution":{"observed_at":"2026-08-11T04:51:41.736295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.435970Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.435970Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:00a8a3d623a22943542f778b3ca65b3e2b8eca29245bdf40b1f837a2e42ecaf4","observation_id":"4d15c7f0-4683-4d32-a25d-048bd19f9614","resolution":{"observed_at":"2026-08-11T04:51:41.435970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.716495Z","title":"Scene text visual question answering,","venue":null,"work_id":"0ad8fbb8-3b91-4b71-98ab-437b56c53cb2","year":2019},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.439636Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:b2ca16b0c35955590c70d4b1d4f313ba5f88bea52d863f1ea3af9ab2c0893414","observation_id":"0fce03ac-160f-474e-be42-57b4f41b65a5","resolution":{"observed_at":"2026-08-11T04:51:41.719788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00812","last_updated":"2018-09-04T07:04:55Z","snapshot_observed_at":"2026-08-15T13:24:13.672350Z","submitted_at":"2018-09-04T07:04:55Z","title":"RecipeQA: A Challenge Dataset for Multimodal Comprehension of Cooking Recipes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00812","snapshot_observed_at":"2026-08-11T04:51:41.443604Z","title":"Recipeqa: A challenge dataset for multimodal comprehension of cook- ing recipes,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.443604Z"},"links":{"cited_paper":"/paper/1809.00812","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:0dfc973541de68385f8d3703687d052856c2a61b97610098153145e48a3b1d04","observation_id":"947b8f29-7617-4143-81be-1827ba2f137e","resolution":{"observed_at":"2026-08-11T04:51:41.443604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.706107Z","title":"Visualmrc: Machine reading comprehension on document images,","venue":null,"work_id":"c56341a3-5d35-45ba-8f11-7b78c1d8d69b","year":2021},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.447736Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:c92076cefeddd0f211d80d984753d282ef007b65251511d5f26f64ac133345c2","observation_id":"6845cd48-f542-4935-a45d-6b161b81db68","resolution":{"observed_at":"2026-08-11T04:51:41.709627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.695449Z","title":"Textbook question answering under instructor guidance with memory networks,","venue":null,"work_id":"38c29135-359a-4ca5-99b9-b45bf2f4c318","year":2018},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.451438Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:0bc68b780e37effa6201146b6e432c39a51c36d2a1ea64ebccdba5e9daf6a305","observation_id":"b9f4e125-59c9-4e21-a69d-a6509f3abd84","resolution":{"observed_at":"2026-08-11T04:51:41.699323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18397","last_updated":"2024-04-29T03:17:47Z","snapshot_observed_at":"2026-08-16T13:57:06.968239Z","submitted_at":"2024-04-29T03:17:47Z","title":"ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18397","snapshot_observed_at":"2026-08-11T04:51:41.455584Z","title":"Viocrvqa: Novel benchmark dataset and vision reader for visual question answering by understanding vietnamese text in images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.455584Z"},"links":{"cited_paper":"/paper/2404.18397","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:a74ee0536dc5fc8713091b00a96c860e86acd4145669dab1e315dcecf4dc3129","observation_id":"9641ece4-cc8e-448f-8941-46004f050281","resolution":{"observed_at":"2026-08-11T04:51:41.455584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.683679Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":"81ab6297-4003-409c-a064-c7b00801f504","year":2021},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.459665Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:59769d457e29d129655ce56b19065d34abfa898c62adc28199099fd15eae8584","observation_id":"0ad4ae96-5f80-4f18-82d8-fd7c1b2137ee","resolution":{"observed_at":"2026-08-11T04:51:41.687924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.671977Z","title":"Infographicvqa,","venue":null,"work_id":"dc2c7c2b-7e06-40b0-bc1d-1e8459e68978","year":2022},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.463469Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:6c25d3410318452ca6065125d13e0ce2cf0125c45a332736c291ab718149a396","observation_id":"4685e783-8a7c-43ea-9679-20d2ad89f37c","resolution":{"observed_at":"2026-08-11T04:51:41.675490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.660697Z","title":"Iterative answer prediction with pointer-augmented multimodal trans- formers for textvqa,","venue":null,"work_id":"ca3b5fd9-625b-41c0-9484-019487f210d9","year":2020},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.466907Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:1ef9a048a1dded96157c670bc09ff73bb0104f1f8084bd0f3e5e972f3763174e","observation_id":"cdc5accd-ca60-4c84-92e9-bf5a8ae19529","resolution":{"observed_at":"2026-08-11T04:51:41.664809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.649393Z","title":"Tap: Text- aware pre-training for text-vqa and text-caption,","venue":null,"work_id":"4cb08647-23e7-470f-b989-4a70a5251953","year":2021},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.470323Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:bdd06798dfd2f8f8e74b7cf6f0e4af88ddb4b325d8fd396fb77aa0329ca00e38","observation_id":"90cfb49b-6902-4e11-9324-50a9f6011988","resolution":{"observed_at":"2026-08-11T04:51:41.653349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.636804Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"a77e3f5e-dea2-419f-8c26-9420e188457e","year":2021},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.473362Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:4b61af3c9d808bf6c3e8be848a9daddcb7ac2567207ca5e546e7e470e744108f","observation_id":"764ffbff-1bd1-4b1c-a658-d51cfe931b0b","resolution":{"observed_at":"2026-08-11T04:51:41.640878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T04:51:41.476261Z","title":"Pali: A jointly-scaled multilingual language-image model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.476261Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:3d570841a9d082eb09bde141c84d781233aaaa9ce7ab9ba6f85cc7c175f8ef0f","observation_id":"c417c1f9-1530-4def-a164-59ff8f68653c","resolution":{"observed_at":"2026-08-11T04:51:41.476261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-17T13:13:49.662318Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T04:51:41.479694Z","title":"Pali-3 vision language models: Smaller, faster, stronger,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.479694Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:129d5ba327c5b804cfd251a91bde83e918d139a570cb460b54460128f0176931","observation_id":"41fc879e-a193-4ee4-a796-5aae5b8012bf","resolution":{"observed_at":"2026-08-11T04:51:41.479694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04615","last_updated":"2024-07-04T07:08:15Z","snapshot_observed_at":"2026-08-16T19:21:14.166921Z","submitted_at":"2024-02-07T06:42:33Z","title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04615","snapshot_observed_at":"2026-08-11T04:51:41.483094Z","title":"Screenai: A vision-language model for ui and infographics understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.483094Z"},"links":{"cited_paper":"/paper/2402.04615","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:1744d688cab4634d4de398b39a4cdae5fb56a3fb62bbbb90c2c74ac734e4a401","observation_id":"3ee8ae27-66d3-44e4-af24-911f9d44c533","resolution":{"observed_at":"2026-08-11T04:51:41.483094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.624186Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding,","venue":null,"work_id":"82bd0611-82e7-407c-9156-bfcdc93325f5","year":2023},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.486401Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:295ceda445317450017adf0be5054c791294a180587a57c8c2ba011169bc8e7c","observation_id":"b162b25a-c8ac-4f19-b3c6-a53157779eba","resolution":{"observed_at":"2026-08-11T04:51:41.629046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.489335Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.489335Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:5929d464e5439b9272c715852c043bcfea5708fbbc1f63e25bc71fa72f56aeee","observation_id":"e2eea61b-064d-4b38-ba10-864913a2286c","resolution":{"observed_at":"2026-08-11T04:51:41.489335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.492694Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.492694Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:088f5eb145bac8f1203f992fc44ac6aac6a0d20a48c690599f9caecf19f798f4","observation_id":"6ce0abf7-27f0-4f9c-bbbc-b94bc4fb3574","resolution":{"observed_at":"2026-08-11T04:51:41.492694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T04:51:41.496349Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.496349Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:a9c7bb242b889b294ad3d7ca732d627dac250b7bfa77ce099a6bd4ebe05e6f77","observation_id":"caf4b0ec-05e8-4315-96cb-dd3096ae5d26","resolution":{"observed_at":"2026-08-11T04:51:41.496349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T04:51:41.500696Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.500696Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:baa551cf8aa1ae4374ec92e465c7b3c4b5ccd157265f7590a7b6a99bdca6edf9","observation_id":"c6f5a895-1ada-4aa3-95e1-5dca3a1ef7b4","resolution":{"observed_at":"2026-08-11T04:51:41.500696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:51:41.599323Z","title":null,"venue":null,"work_id":"0542f527-08dc-454e-a83f-946fce9543ba","year":null},"citing_paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","version":1},"reference_index":500,"source":"pdf_text","source_observed_at":"2026-08-11T04:51:41.504443Z"},"links":{"citing_paper":"/paper/2412.18327"},"observation_digest":"sha256:20197741ee3ca6f9ab9c75f24a08c79dc56399f06e34cc039275500b403d0c86","observation_id":"77b65599-22bc-4802-b0fd-8dc5b7e743b1","resolution":{"observed_at":"2026-08-11T04:51:41.603712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18327","last_updated":"2024-12-24T10:25:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T16:46:01.417119Z","submitted_at":"2024-12-24T10:25:41Z","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.18327."}