{"as_of":"2026-08-21T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:348149a0dae3ba7b2cb92a06257a6afabc573a941a2a119c0d7d15b3b02d85de","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:08:52.342090Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.05446/citation-record","integrity":"/paper/2505.05446/integrity","json":"/paper/2505.05446/citation-record.json","paper":"/paper/2505.05446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.445334Z","title":"Au- tomaTikZ: Text-guided synthesis of scientific vector graph- ics with TikZ","venue":null,"work_id":"c8b9e02b-4295-47af-b74f-2a4433707a9c","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.360963Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:3601798d3a997648e6c90d633c2f5c6d6dbe701910936c9b72fe8dfa7d9bd63a","observation_id":"44de7fcd-6490-404c-aa00-b3099dce6f5a","resolution":{"observed_at":"2026-08-15T23:08:54.449902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.340136Z","title":"DeTikZify: Synthesizing graphics programs for scientific figures and sketches with TikZ","venue":null,"work_id":"3680548f-118a-45ea-b624-5d74dcc93622","year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.444090Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:542b1a8b492aa2b6dd48e99daa56c705952a4d804e3a5d8a3c61a7af3892184e","observation_id":"b4f7802e-dcef-4357-babd-25f8bb87b9ce","resolution":{"observed_at":"2026-08-15T23:08:54.436810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.327209Z","title":"Scene text visual question answering","venue":null,"work_id":"3319db53-b48b-4206-a174-a4e4d0c7ce33","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.485954Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:fa71ad8a2bdf534d1517549160eee840318fc5a211cbc671cd50362d0ec7713e","observation_id":"a04f5739-81b5-4c47-a927-96adfbdcfaff","resolution":{"observed_at":"2026-08-15T23:08:54.332181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-15T23:08:50.491089Z","title":"Nougat: Neural optical understanding for academic documents.arXiv preprint arXiv:2308.13418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.491089Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:53a0d5bbb771509545c2f8e36dd261b6a71751e0f1acad59a82e0acff67f28fb","observation_id":"941fc196-2803-45a1-9ab8-cae16487696a","resolution":{"observed_at":"2026-08-15T23:08:50.491089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.313091Z","title":"Onechart: Purify the chart structural extrac- tion via one auxiliary token","venue":null,"work_id":"09e9ecfc-2e73-40d0-9b28-e2647c438293","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.496304Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:fc78786ff45043e6a4a24567976025542f6f1802ef847fbfa490de589a39eb04","observation_id":"c90c241d-7996-4298-acb4-4583b69951b8","resolution":{"observed_at":"2026-08-15T23:08:54.318027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-15T23:08:50.501111Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.501111Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:75c652bef57bb9674ab890f279cfa180055d5d41048b2ad52d1441d6d69917aa","observation_id":"2c1ff4e6-b7b4-4ae7-8400-3044113cfc7a","resolution":{"observed_at":"2026-08-15T23:08:50.501111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09465","last_updated":"2021-11-08T08:31:44Z","snapshot_observed_at":"2026-08-16T18:50:31.552736Z","submitted_at":"2021-01-23T09:43:44Z","title":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09465","snapshot_observed_at":"2026-08-15T23:08:50.505215Z","title":"Websrc: A dataset for web-based structural reading comprehension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.505215Z"},"links":{"cited_paper":"/paper/2101.09465","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:ca2d378bd426368d30144686f28d0b66049de1c564895ded1cb7f2bfabb7bc87","observation_id":"f00b2977-ba1c-4df6-a042-a5141caa90f3","resolution":{"observed_at":"2026-08-15T23:08:50.505215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T23:08:50.510896Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.510896Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:d25ac06f44040b02d65d255b5a60e66194b8327ddc5aedbb1dad3b2ca120acf8","observation_id":"6e24ccaf-f037-40a1-a15e-e4c4903d3014","resolution":{"observed_at":"2026-08-15T23:08:50.510896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.269867Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"a98df955-82b9-45de-9966-ca179f6263ce","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.567479Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:5567ab81251803fee469dcc396e3bc94d0a6e9798d08ffbd688be9bab79222cc","observation_id":"84a9a66b-0bb7-4def-9a8d-d123e137dccf","resolution":{"observed_at":"2026-08-15T23:08:54.304245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04729","last_updated":"2019-08-28T16:24:53Z","snapshot_observed_at":"2026-08-14T13:31:38.766179Z","submitted_at":"2019-08-13T16:47:08Z","title":"Complicated Table Structure Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04729","snapshot_observed_at":"2026-08-15T23:08:50.588436Z","title":"Complicated table structure recognition.arXiv preprint arXiv:1908.04729, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.588436Z"},"links":{"cited_paper":"/paper/1908.04729","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:876e92d8325a5590deb5b9fd92c4ea5d652ce0852c9ee9440bbdc6b61a0f64ca","observation_id":"3a87248b-98d1-4384-9a5d-f1bfb82ca3bc","resolution":{"observed_at":"2026-08-15T23:08:50.588436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-16T14:41:50.232808Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-15T23:08:50.701331Z","title":"Docpedia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding.arXiv preprint arXiv:2311.11810,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.701331Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6e1dd1170dc7448b55201bdae5a4ffe0d5d5b06122f7d1cbaf2993da7df64723","observation_id":"93c99fa7-5177-4118-a41f-7018fc45724c","resolution":{"observed_at":"2026-08-15T23:08:50.701331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.241952Z","title":"G-llava: Solving geomet- ric problem with multi-modal large language model, 2023","venue":null,"work_id":"29be8151-1981-4a93-8557-96756cb2e550","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.740427Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:d50d3b48805f045fbcea2e9123672f8727c4a1f527303cfb75c0ed6008cfc1af","observation_id":"9ccfac39-359c-43f5-ac9d-c6d97d994414","resolution":{"observed_at":"2026-08-15T23:08:54.247784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-19T23:16:39.427866Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-08-15T23:08:50.745849Z","title":"G-llava: Solving geometric prob- lem with multi-modal large language model.arXiv preprint arXiv:2312.11370, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.745849Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:197e0169739359cef1ca80838faa83cc59b9dc8441a21f6774fb1a2c59912767","observation_id":"acf0312e-3aea-4063-a99e-eb6897865239","resolution":{"observed_at":"2026-08-15T23:08:50.745849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10690","last_updated":"2025-03-29T12:18:26Z","snapshot_observed_at":"2026-08-18T08:55:36.196427Z","submitted_at":"2024-04-16T16:10:23Z","title":"MathWriting: A Dataset For Handwritten Mathematical Expression Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10690","snapshot_observed_at":"2026-08-15T23:08:50.751241Z","title":"Math- writing: A dataset for handwritten mathematical expression recognition.arXiv preprint arXiv:2404.10690, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.751241Z"},"links":{"cited_paper":"/paper/2404.10690","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:cd26ccab5e7dc9dda4ac70d78ffeda0d7ecbd107922bff85c8c5132749967ef9","observation_id":"9ae419b8-c3a0-4a49-bc84-717668730182","resolution":{"observed_at":"2026-08-15T23:08:50.751241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-16T15:02:27.041378Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-15T23:08:50.755574Z","title":"Imagebind-llm: Multi-modality instruction tun- ing.arXiv preprint arXiv:2309.03905, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.755574Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:313b1c0252e49056704e58e7b683148771d9a5e6462a9d3bcd6f71a5406264d0","observation_id":"9469f8fe-955f-4044-a005-7086ea73b5cb","resolution":{"observed_at":"2026-08-15T23:08:50.755574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.228367Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"785ff68d-636e-4d87-a70c-d345ffb6d043","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.759741Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6ab5f9beb1611c36b7d7fbd0314d8d77c03a4ea2233d8ac5eccaee9190c82b89","observation_id":"0882036b-164f-4497-b06a-85f854dc7042","resolution":{"observed_at":"2026-08-15T23:08:54.233788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-16T14:08:19.332089Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-15T23:08:50.763889Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding.arXiv preprint arXiv:2403.12895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.763889Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:9224b4d93af8dd9d1470c45d359205437371010a2985e1cab135015d80fe2fa8","observation_id":"423749f3-1393-4285-a447-57066666117c","resolution":{"observed_at":"2026-08-15T23:08:50.763889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.213134Z","title":"Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction","venue":null,"work_id":"2af0c79e-a9c9-41dc-bfa6-3c27d699afc8","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.864930Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:cbe2f0b4fbeef8cd4892caf4716edde3093f9adbee66f253948e18e560306491","observation_id":"35a35a60-4480-43da-9239-1340ba8b725d","resolution":{"observed_at":"2026-08-15T23:08:54.218188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.140553Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"9715be0c-9343-47ba-ae7e-dee81b99a121","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.869149Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:8c65bc91894ec01831be051465053e80f42c2c7d4f192ffe6b314e81d214a0b7","observation_id":"537c7fa5-3bf6-4da7-9eeb-275ef31a95b0","resolution":{"observed_at":"2026-08-15T23:08:54.178053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.127155Z","title":"Revisiting scene text recognition: A data per- spective","venue":null,"work_id":"12b9a745-2ed3-493d-9dcc-0f19c56e4c43","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.873974Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:0872d68e0e45ce35e273b514c34f9ae868d0f7026aa18f14bfbaab524f3188af","observation_id":"8fca41c6-d9be-48c6-b7b3-ed7f004ba0ca","resolution":{"observed_at":"2026-08-15T23:08:54.131556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.114502Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":"3ac9d2e4-b839-43ed-bb63-644a37dd549c","year":2018},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.878908Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:36b0962d2ba0280d06c2c6abd981616fa3177c6f0dfaf77023a7c284f0bdcffd","observation_id":"dbcb6e44-73f9-4d68-9a63-2ceebab4812a","resolution":{"observed_at":"2026-08-15T23:08:54.118741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.099913Z","title":"Icdar 2013 robust read- ing competition","venue":null,"work_id":"0bff72b9-55d4-4459-bf6b-8b7fbfd9415b","year":2013},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.884108Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:66625021c7a2820059374fc91071696fa29f796cd066bff23c815a4433131258","observation_id":"7adfcb41-ad6f-4f8b-9ac8-af84783e55d8","resolution":{"observed_at":"2026-08-15T23:08:54.105042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.059801Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"269643e9-b8ab-4041-aaa1-a7dc37d03c30","year":2015},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.887834Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:4b5525e25940f1e44868077ab8de00f5d2573285351806c56861c3fad3be0a99","observation_id":"c963a7f8-e702-4c4c-a539-633f4b09a945","resolution":{"observed_at":"2026-08-15T23:08:54.090467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:50.892593Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.892593Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:2ffe2d0c2182d09f6312d04ad39d573b9de23cda8431cd817de9f3cad725e8b5","observation_id":"0aa04442-fd9a-4ecb-93be-248b41e0fd04","resolution":{"observed_at":"2026-08-15T23:08:50.892593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.035273Z","title":"Openassistant conversations-democratizing large lan- guage model alignment.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"0113c366-4139-48ae-81c9-03b6dde4bbdb","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:50.912468Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:2d5f730e5c6c7dcaacad4289bad4112090dd7875bc82b630072a2f54562208df","observation_id":"ef09898d-750d-46ca-9d18-02d7410f8be8","resolution":{"observed_at":"2026-08-15T23:08:54.039697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:54.018409Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solu- tion","venue":null,"work_id":"e01ec694-ab21-4f8f-8e8b-a8269989c6e1","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.001750Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:21d0e7e3f4788acacba2ff4b30eca18e9854b87f371db51bc520696af9f26945","observation_id":"0b92f8a9-5590-471d-b182-e0510bdb4375","resolution":{"observed_at":"2026-08-15T23:08:54.026666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-08-16T14:09:59.275779Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-08-15T23:08:51.006221Z","title":"Unlock- ing the conversion of web screenshots into html code with the websight dataset.arXiv preprint arXiv:2403.09029, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.006221Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:09f6e62f2b4827e7c2ca71641274f2039e23bda540dc1d82d325130c92cec138","observation_id":"eacbb7c1-5e47-4b45-9a7b-dbc794caf5b4","resolution":{"observed_at":"2026-08-15T23:08:51.006221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.969702Z","title":"Docmatix dataset.https://huggingface","venue":null,"work_id":"0675c4c7-c065-4754-83af-e17ca45b990a","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.010835Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:1b7ea409f5dca157e5063ad27725b992972a531c48543870ac4df797367340a4","observation_id":"3740c690-0340-41b4-bba2-d560e50f4f95","resolution":{"observed_at":"2026-08-15T23:08:53.991853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.952958Z","title":"When counting meets hmer: counting-aware network for handwritten math- ematical expression recognition","venue":null,"work_id":"eb96b120-859e-4b4b-8805-2bc319bd2230","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.015778Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:85701b7c485f524b7f2c8a6faf52589f5fac8b74a023be941c59e39221443733","observation_id":"0a090194-7485-4d18-93ae-fbe83f66bed8","resolution":{"observed_at":"2026-08-15T23:08:53.958651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T23:08:51.020428Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.020428Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:51c2187660dd73b6118f5a95e40622cb4bdc5e13f9771e25655800c5d6854129","observation_id":"fc9495b3-c0bf-4d05-b34f-b9b57932b061","resolution":{"observed_at":"2026-08-15T23:08:51.020428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T23:08:51.024767Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.024767Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:94e0f59e6d893b807b19392bc8dd88e5e13214193a293e3f66f3d1b2f7fb73fa","observation_id":"87faa7b8-5261-4eda-ad00-a04cb3e8ab59","resolution":{"observed_at":"2026-08-15T23:08:51.024767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-15T23:08:51.057587Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.057587Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6667e49c1f7878e3d091bf2f059936c4004a1427cd35463c3f82df44f3320e39","observation_id":"56e408e2-84b5-4f09-bf76-53378ba7cd81","resolution":{"observed_at":"2026-08-15T23:08:51.057587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.937331Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"c3787609-7096-4ae5-a36d-ba8ffca89f81","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.107858Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:51a3aff1afdd139e83c1fa8850ae7419ef270c1f1e5c28abc3ef16bed9f2b018","observation_id":"f3c3310f-88d5-47a6-accf-79aaf5186120","resolution":{"observed_at":"2026-08-15T23:08:53.943284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-15T23:08:51.128928Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models.arXiv preprint arXiv:2311.07575, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.128928Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:5bfa5b01ec4394bb12462608a50994c36e918466b08c950e005f4fd8b5d4cb1c","observation_id":"16cdadcf-dcaa-4ee2-8d23-365128d973fa","resolution":{"observed_at":"2026-08-15T23:08:51.128928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T23:08:51.133780Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.133780Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:7456115e851f29188f92b8c824619bc6442985b2ae4edabb7c92c82c56f9b1d6","observation_id":"5f31cc37-4a91-4ef2-8cec-9edded724a85","resolution":{"observed_at":"2026-08-15T23:08:51.133780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:51.186321Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.186321Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:144c5624de15d5989d82f887912aea573af90d05bcd4433fe4998c9011da8fc5","observation_id":"a4f4326a-ca18-4762-b33c-7be770ea2b88","resolution":{"observed_at":"2026-08-15T23:08:51.186321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.891941Z","title":"Visualwebbench: How far have multimodal llms evolved in web page under- standing and grounding?, 2024","venue":null,"work_id":"7aa30271-9986-4ddc-a82a-589898d88c5e","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.224727Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:c80c845790081d19e7939dd31013c3083b0eb1404f0fe8df4c0b6341beff078d","observation_id":"c3850ba8-bba0-4961-96f5-8c67cdf312e2","resolution":{"observed_at":"2026-08-15T23:08:53.907864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-15T23:08:51.229797Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.229797Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6715727506674062aeb9a69fbd71e3633887f0615f3eb89a65c1e84d490ac3ba","observation_id":"22bdc781-3999-4107-9311-c625b02c7084","resolution":{"observed_at":"2026-08-15T23:08:51.229797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-19T13:06:25.132325Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-15T23:08:51.234125Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document.arXiv preprint arXiv:2403.04473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.234125Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:3a0059046a4ac5f6cf4afa9cf0380c20417b04248970739a9924d9b04af1c57b","observation_id":"3d98969a-46df-4552-8f3e-845d90a7d4ac","resolution":{"observed_at":"2026-08-15T23:08:51.234125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.875455Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":"5f103637-db69-4518-8a5d-a046198c4532","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.238255Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:64e08e4584d6d60448d04a01e7d6a52ccda327ded943146d18fb926c05b654b6","observation_id":"f0e294dc-0f64-4f08-8c8f-492a9028c9f1","resolution":{"observed_at":"2026-08-15T23:08:53.880831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.836347Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and sym- bolic reasoning","venue":null,"work_id":"55da6ae7-c377-4019-8f05-ec48617ed216","year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.242047Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:3dcf4f2ae64d446cf43a58980abd88d1160715d6254678eb6253d94f0b882843","observation_id":"26c5c5f3-e426-4c74-9b09-b033ce70db73","resolution":{"observed_at":"2026-08-15T23:08:53.851414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.812754Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":"131d440f-1b85-44a8-944f-4d56e406ff4e","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.352094Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:5b3aad7786acdbf93f321ad50b587443a8aa3d812b5d211a5caf859b463c3d50","observation_id":"e38818c9-4342-4872-9d5d-88f6529e1f4a","resolution":{"observed_at":"2026-08-15T23:08:53.818038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.770519Z","title":"V Jawahar","venue":null,"work_id":"97d9489f-3f19-44cd-b0df-6fc882bb93b8","year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.431640Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:392702bcebfd17a8d9ce3782e8fc76405e39d1a21fb09b0db325f3cb0e8be7a0","observation_id":"f2d84bb7-0985-4d1f-82e4-af39afe7b3db","resolution":{"observed_at":"2026-08-15T23:08:53.803621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.727219Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"3c70807a-fb53-4cbb-8940-9afedfef5cf7","year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.435477Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:692919c324fb37a884fec572f1945e0b7e8bee3b0175c71ea24e3b4caac9f84c","observation_id":"fab00ed6-d167-49a8-b0b8-87ff19e275a0","resolution":{"observed_at":"2026-08-15T23:08:53.732117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:51.439981Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.439981Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6a3641e2906b26cbc5a7861e694f7078cc8dcf47274d222d0ccdc6f62c84cb7d","observation_id":"c58d1bd8-7718-44c6-a068-62ea7207e501","resolution":{"observed_at":"2026-08-15T23:08:51.439981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01017","last_updated":"2022-03-11T14:03:47Z","snapshot_observed_at":"2026-08-16T17:17:33.433717Z","submitted_at":"2022-03-02T10:46:24Z","title":"TableFormer: Table Structure Understanding with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01017","snapshot_observed_at":"2026-08-15T23:08:51.444111Z","title":"Tableformer: Table structure understanding with transformers.arXiv preprint arXiv:2203.01017, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.444111Z"},"links":{"cited_paper":"/paper/2203.01017","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:c19ca172648f49235ae7cd1dc9448f08f515df7fde5695fde977d85218662137","observation_id":"5a30488f-ad31-4d6c-9b82-c12b060e3bbe","resolution":{"observed_at":"2026-08-15T23:08:51.444111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.682617Z","title":"Chatgpt.https://chat.openai.com, 2023","venue":null,"work_id":"f2ecbfe7-4c02-4dd2-85b3-9304e5923966","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.448954Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6fbd151be657e639c5b00e1db6226d822e1ad80fd5b7298f759b4c4c81364664","observation_id":"841dcd17-c17b-4980-b4f1-ec88b48646cb","resolution":{"observed_at":"2026-08-15T23:08:53.708357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T23:08:51.453832Z","title":"Gpt-4 technical report.ArXiv, abs/2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.453832Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:99049fb1c9aec589bf2e9f555f8c040826f0d24760a79c537561f8ed551310f2","observation_id":"162f744d-64d1-433b-bedf-63d2467bddd6","resolution":{"observed_at":"2026-08-15T23:08:51.453832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.669269Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"9b50a467-6a65-4026-8a7d-d516b83065b7","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.503220Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:719f513be2d3b92a1f7501af91a98e02a12bb3b1ea8cea5f65043a8422e53929","observation_id":"5c5577d2-9d1e-4491-b448-e12047bacfd2","resolution":{"observed_at":"2026-08-15T23:08:53.673222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.619470Z","title":"Cord: a con- solidated receipt dataset for post-ocr parsing","venue":null,"work_id":"ee00def2-b087-4495-867f-2d4e4b358efe","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.539927Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:674e8b5731ed1730216f2af4b8197fcd9cbfb5467d9cf0b78bc7acef74de9e27","observation_id":"6d581baf-0a6a-4422-ab2f-232eebd5f580","resolution":{"observed_at":"2026-08-15T23:08:53.644893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-16T13:22:43.390351Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-15T23:08:51.545097Z","title":"Multimath: Bridging visual and mathe- matical reasoning for large language models.arXiv preprint arXiv:2409.00147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.545097Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:60bb4b88b9a995fa3bca890cf8c297ad8481f50df6cfbe5fc9e1ab03a3080b56","observation_id":"9783b180-e7fe-4fc2-a1cc-867a29e12868","resolution":{"observed_at":"2026-08-15T23:08:51.545097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.605404Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":"a37f8570-112e-4634-8680-cced08109303","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.627950Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:f71b02f06acfea813c555b23529040f4270d362e94949cfaff90103b296391bf","observation_id":"9d718dc0-ddd2-4652-bd37-83cac6334546","resolution":{"observed_at":"2026-08-15T23:08:53.611521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.570477Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv e-prints, pages arXiv–2403, 2024","venue":null,"work_id":"a42b6478-1cdd-4013-afda-15238b15ad65","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.748557Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:0330d4ea5bad7b7577c5b76e55ea65bde8b3bac3c703c88b103bff973ba0dd90","observation_id":"58d14f95-aa7a-45f8-bb40-7e2f252b0480","resolution":{"observed_at":"2026-08-15T23:08:53.595885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.519500Z","title":"Icdar2017 competition on reading chinese text in the wild (rctw-17)","venue":null,"work_id":"3a86063d-88eb-4794-abaf-576b65ef8d6d","year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.795572Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:bb9f2d172c40b9bbca311182405cb79b4268a243c277ef1303f99d680c46cb54","observation_id":"2a6bd541-baf3-48fd-b6c0-6323a2ff5c15","resolution":{"observed_at":"2026-08-15T23:08:53.523375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.483340Z","title":"Towards vqa models that can read","venue":null,"work_id":"55de6461-66c4-480b-b2e0-d66cf23716c6","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.800403Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:ee706329ae2a40b25727d062c0cb369a8aae7c052d19da249f6aaeba50d78e84","observation_id":"00ce7920-1e11-49b4-ba66-e0ea3c37dcd8","resolution":{"observed_at":"2026-08-15T23:08:53.505733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.468057Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"b99c368b-dba6-4491-ae48-01d7c05d5953","year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.805429Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:679ebf53a895ccce1dc91e5cdc89c297a6097d580c9d3d35b7dbfaeaf32ee298","observation_id":"81387647-952a-479e-867d-044615ede585","resolution":{"observed_at":"2026-08-15T23:08:53.473925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14470","last_updated":"2021-03-26T13:46:00Z","snapshot_observed_at":"2026-08-20T00:16:28.272727Z","submitted_at":"2021-03-26T13:46:00Z","title":"Spatial Dual-Modality Graph Reasoning for Key Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14470","snapshot_observed_at":"2026-08-15T23:08:51.809034Z","title":"Spatial dual-modality graph rea- soning for key information extraction.arXiv preprint arXiv:2103.14470, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.809034Z"},"links":{"cited_paper":"/paper/2103.14470","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:6069294873a15072ebe3cc682ce8b1d6498d03e17af4070fea515e5a8ddc6314","observation_id":"f64efca0-3d6f-4ff7-aca3-99c6fa340b25","resolution":{"observed_at":"2026-08-15T23:08:51.809034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.408536Z","title":"Icdar 2019 competition on large-scale street view text with partial labeling-rrc-lsvt","venue":null,"work_id":"534b45cb-81db-45a2-871a-0dcba7d76860","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.813894Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:b8cb208efa9669ba929b3c99946557dbb17b929df3eeb9814801043e233673e9","observation_id":"7ee44980-8101-4545-9080-8d4175fe7c0f","resolution":{"observed_at":"2026-08-15T23:08:53.459557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:51.818507Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.818507Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:afb3ea78c1fe9886717461213cfdf79b84d9bf8f2bb244446c3ffc9a2a78cc93","observation_id":"35ffffdd-eff8-4d0f-8ba9-996962eda127","resolution":{"observed_at":"2026-08-15T23:08:51.818507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T23:08:51.878962Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.878962Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:997ce31e57122bae4a79d3e7db061a3fcbf1febcd8a2c46914636bdf3471389a","observation_id":"cac7b022-3036-4974-babc-824a47373cf1","resolution":{"observed_at":"2026-08-15T23:08:51.878962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-08-14T22:13:00.450823Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-15T23:08:51.969524Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images.arXiv preprint arXiv:1601.07140, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.969524Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:212e7ccbf07036e6d581ec0417d3868018397d6fe602771e9508169ee5b5cc6d","observation_id":"c2a191ff-1344-40a5-a6b8-ca3f7b1a630a","resolution":{"observed_at":"2026-08-15T23:08:51.969524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.351874Z","title":"Measuring multimodal mathemat- ical reasoning with math-vision dataset, 2024","venue":null,"work_id":"62c64ea7-176f-41a7-97f5-24a45b611afc","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.974634Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:f5255c4c7c1cdd4c148b8b34dc828ec907eeebaa3e0f3ce0867dd958c5bf5bea","observation_id":"2f7fb109-156f-4f24-b39a-101539bb3ab4","resolution":{"observed_at":"2026-08-15T23:08:53.356298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T23:08:51.979528Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.979528Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:5fb04790f718d17778020ced1d526e17f75975237875705ff040e83d94e72c96","observation_id":"7a1efaed-b0d0-4f4d-b5ad-a3abd983b7ea","resolution":{"observed_at":"2026-08-15T23:08:51.979528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.338987Z","title":"On the general value of ev- idence, and bilingual scene-text visual question answering","venue":null,"work_id":"e1828f42-99a3-408d-9d2e-c6f0e4f7c09a","year":2020},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.984044Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:df64fcf0b12d7ce8c1dae75e8f10eda6b97f235b91c711fb6ebb452976a82cda","observation_id":"2c687a36-62e2-4d01-a1bd-69b66d8fe781","resolution":{"observed_at":"2026-08-15T23:08:53.343783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.268385Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model","venue":null,"work_id":"86a6616a-1456-4651-aaf0-32ddab690dbc","year":2025},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:51.988895Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:97ab7dc78e442a9ee8b90f9d5e4d83651dc92c45a05894f887e008fa16a84482","observation_id":"5dcf2f51-9e6b-4896-8c6b-a2070646d065","resolution":{"observed_at":"2026-08-15T23:08:53.276269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.254461Z","title":"Toward understanding wordart: Corner-guided transformer for scene text recognition","venue":null,"work_id":"17257e8a-9166-48b4-8c11-6a337a9e5648","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.076260Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:32df02043f39c65b8d5724719ffed08950609cd6199182af50119b111c0e4bf4","observation_id":"cf6d6f5b-fe80-4f4f-a99c-2df0ec142db4","resolution":{"observed_at":"2026-08-15T23:08:53.259690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.150058Z","title":"Xfund: a benchmark dataset for multilingual visually rich form under- standing","venue":null,"work_id":"63bac625-6ae4-4238-91f3-810d70d7d009","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.080316Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:38739cf4b7d3127ba8c609e78f6ef36527cf110997b9804cfda269694643e3fb","observation_id":"ab7e3ebd-126c-4a2c-be6e-4037f1143f18","resolution":{"observed_at":"2026-08-15T23:08:53.243919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.136327Z","title":"Tgrnet: A table graph reconstruction net- work for table structure recognition","venue":null,"work_id":"e48cbcbc-ace4-4e3b-b7b7-3a9d689ed793","year":2021},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.084510Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:1ba238c127b8d2445ac0976168d63c532a653b3c49b655027aa5c8b9c9e67fe9","observation_id":"1e2dd512-7d28-422b-9972-c10ec4d8d51b","resolution":{"observed_at":"2026-08-15T23:08:53.141050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:53.072953Z","title":"A large-scale dataset for end-to-end table recognition in the wild.Scientific Data, 10(1):110, 2023","venue":null,"work_id":"bebafa16-2af7-4718-bf07-bc85bb148015","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.088527Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:938a6be9385c8b5fe049d536ad3f80efa3dc15cbbb558dcb5eb5405097926fa4","observation_id":"1ef12314-b89f-4532-8fcf-fbde5f03a3d6","resolution":{"observed_at":"2026-08-15T23:08:53.127344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-21T09:42:09.574596Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-15T23:08:52.092596Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model.arXiv preprint arXiv:2310.05126, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.092596Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:034884b26f1967faecb6ebc8f668f72a1256971c494c05c420c196eb252f3e87","observation_id":"95a8e5eb-970f-4e92-ad66-8d2e24d4f79a","resolution":{"observed_at":"2026-08-15T23:08:52.092596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.983206Z","title":"Icdar 2023 competition on structured text extraction from visually-rich document im- ages","venue":null,"work_id":"d470a6b0-fa39-4a97-aba1-bf14ae6117be","year":2023},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.097699Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:867130b78179a8a7d39c64a506bfc5f56e2c24c23de5ec91ae18d5f18c279f81","observation_id":"102e7b8a-ffbc-4d6e-be24-f0867ae3c2c6","resolution":{"observed_at":"2026-08-15T23:08:52.987500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.897864Z","title":"Syntax-aware network for handwritten mathematical expression recognition","venue":null,"work_id":"df3fec27-50a3-4977-9052-b87394da7602","year":2022},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.101990Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:8e26941c9d7df195297eb06b3912922267a34ecff49c9b2869bf7c3311081e26","observation_id":"555b5dd8-002c-4868-ac4b-d776363d8406","resolution":{"observed_at":"2026-08-15T23:08:52.974402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02170","last_updated":"2017-12-06T13:02:43Z","snapshot_observed_at":"2026-08-15T14:07:23.809064Z","submitted_at":"2017-12-06T13:02:43Z","title":"Detecting Curve Text in the Wild: New Dataset and New Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02170","snapshot_observed_at":"2026-08-15T23:08:52.197635Z","title":"Detecting curve text in the wild: New dataset and new solution.arXiv preprint arXiv:1712.02170, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.197635Z"},"links":{"cited_paper":"/paper/1712.02170","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:7c51f7a47b23fea96de89c8ea41a1757cb030bb42708ee7ff1eacb5ed3407168","observation_id":"11aefa47-b1fa-445e-bf97-aa85ada1a6b7","resolution":{"observed_at":"2026-08-15T23:08:52.197635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19185","last_updated":"2024-07-27T05:53:37Z","snapshot_observed_at":"2026-08-16T13:30:36.830265Z","submitted_at":"2024-07-27T05:53:37Z","title":"LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19185","snapshot_observed_at":"2026-08-15T23:08:52.203082Z","title":"Llava-read: Enhancing read- ing ability of multimodal language models.arXiv preprint arXiv:2407.19185, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.203082Z"},"links":{"cited_paper":"/paper/2407.19185","citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:0d4162a6a2baa7ac76f827b8f6ec7e55c853e2e271c70a995f29857005998dd2","observation_id":"97b5a255-71c8-4c62-9a18-46fd0f6bdf04","resolution":{"observed_at":"2026-08-15T23:08:52.203082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.207933Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.207933Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:536567ad9a7bbb1b94d5b4f914b984bc84e41597ced9d638e0335b522212045c","observation_id":"3f52d260-71b8-4827-8cbb-3806f05b94e7","resolution":{"observed_at":"2026-08-15T23:08:52.207933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.876575Z","title":"Lima: Less is more for alignment.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"3dc4f688-2c27-4432-83ff-66abf5297aca","year":2024},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.211898Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:09f61a51d323f8fc3c4a53e4207ab6f356a9e68aa77d898b8c670601582a49da","observation_id":"c5ee0e39-02ff-4ed2-b880-fa60c8a1a524","resolution":{"observed_at":"2026-08-15T23:08:52.881171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.810249Z","title":"- Answer: The known answer to the question","venue":null,"work_id":"b91be478-ae3f-4511-ab55-f1900b20140d","year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.216345Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:d6c2902e258f5d11918e07e35b309528d159e0e01fb84e403f447356a0642bcd","observation_id":"dae84381-e88b-4ee2-bb1a-8dd3f0c4e0ba","resolution":{"observed_at":"2026-08-15T23:08:52.866566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.774727Z","title":"- `<txt_gd></txt_gd>`: Text with coordinates for context","venue":null,"work_id":"8b968fa3-6ff6-4239-855d-6a45546cda1e","year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.328887Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:958f59f949e34907f802239866d8d2643e60e75e79eac918210262d625745093","observation_id":"50b3169c-79a7-4055-905b-18333b55a3e7","resolution":{"observed_at":"2026-08-15T23:08:52.779914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.760484Z","title":"- Ensure that the extracted content retains its original formatting","venue":null,"work_id":"ba524dcc-0ca0-451a-80af-7a6df9fcc7ce","year":null},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.337274Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:2abe72405ad4163f373b36f1868ed9b53f68525ba3edc388accc86666876627f","observation_id":"eaf472a1-940f-4aa9-8f29-aac0b996b54e","resolution":{"observed_at":"2026-08-15T23:08:52.766246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:08:52.717664Z","title":"title\":","venue":null,"work_id":"8f973125-cb9c-45eb-80d2-c2b408abf489","year":2019},"citing_paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T23:08:52.342090Z"},"links":{"citing_paper":"/paper/2505.05446"},"observation_digest":"sha256:ce5f3b4917362b65d1d4b20927ebe074d750c06677f5c25a23568b8505732613","observation_id":"481d3b8f-4f52-41e7-860a-0a68407ee8f3","resolution":{"observed_at":"2026-08-15T23:08:52.752277Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05446","last_updated":"2025-05-08T17:37:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:56:26.674938Z","submitted_at":"2025-05-08T17:37:36Z","title":"Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2505.05446."}