{"as_of":"2026-08-17T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21a6d0aec0d2f70c9bacc4483cd56e5191be3f0bd4fd0dd843a97865cd5fab78","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:01:15.691092Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:13.243457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:31:32.012726Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00063","snapshot_observed_at":"2026-08-15T23:21:13.243457Z","title":"Gdi-bench: A benchmark for general document intelligence with vision and reasoning decoupling, 2025 g","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":255,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:13.243457Z"},"links":{"cited_paper":"/paper/2505.00063","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9b2afe8c93aeeecce0e151974d4d841d4846fb3a12c995751bd645a9d8f3f8c6","observation_id":"8a091469-9a7d-47a4-8830-d8e7bd55df8e","resolution":{"observed_at":"2026-08-15T23:21:13.243457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"cited_work":{"arxiv_id":"2505.00063","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00063","snapshot_observed_at":"2026-08-07T14:31:32.012726Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","venue":"cs.CL","work_id":"a632f3d4-eaa2-4dd9-938d-26b07f18e97f","year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:20.388845Z"},"links":{"cited_paper":"/paper/2505.00063","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:8902fb79c1d44558c54da4b2aa79378046108de07697ad20a28be4385ebf0322","observation_id":"52333cf1-07aa-4464-b696-c4a155fd1775","resolution":{"observed_at":"2026-08-07T14:31:32.084497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00063/citation-record","integrity":"/paper/2505.00063/integrity","json":"/paper/2505.00063/citation-record.json","paper":"/paper/2505.00063"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T05:01:15.436465Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.436465Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:3bcf61c7ec5b404ff9f24432b5af2cf4cdbdab62500c96db5a612f18f345abd9","observation_id":"ef23dea0-97f7-47c4-9b64-37c34d6f770a","resolution":{"observed_at":"2026-08-16T05:01:15.436465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T05:01:15.441586Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.441586Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:d1e62699791ad6ce6966ad0b9e5c9b760b6661efda08f56321d7914fa96e99fc","observation_id":"0dfed56a-93db-49c8-9cfa-80589c13faca","resolution":{"observed_at":"2026-08-16T05:01:15.441586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T05:01:15.447113Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.447113Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:5a18b94fcf7fed5ebe291a1e8e8d5f802556903099113a9fc44ba52de92ceb37","observation_id":"7aae03d6-3165-4c7c-99a4-e49e9c0aa1a3","resolution":{"observed_at":"2026-08-16T05:01:15.447113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.451755Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.451755Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:1fdde35e257cd38a35fc12beeaed9daef3bdb048727930eef01d5962632d7511","observation_id":"8eee5f11-ab8e-41a7-911d-38b2212b53bc","resolution":{"observed_at":"2026-08-16T05:01:15.451755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T05:01:15.456539Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.456539Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:5d3d6ab14132c2257829a6076b1d72a8446b7fe8dfd73bbfb06a66d280f98359","observation_id":"95cb0b15-fffa-490b-9382-f9fcbe081f46","resolution":{"observed_at":"2026-08-16T05:01:15.456539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.461285Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.461285Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:015ce17086e0ab6161254d372d6b821d64573f732b9e534fec341319a041f626","observation_id":"256032a7-155c-4392-8f4f-5144e4ffb11c","resolution":{"observed_at":"2026-08-16T05:01:15.461285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.454432Z","title":"Autohallusion: Automatic generation of hallucination benchmarks for vision-language models, 2024","venue":null,"work_id":"78292f5b-e669-469a-929f-07aa6c177ba0","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.465415Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:80440830aa035d56e61f891b792d94b1e0bfe2f8dada9c3a481f7b4155608785","observation_id":"e4037381-cace-4743-b36c-11cceef578b5","resolution":{"observed_at":"2026-08-16T05:01:16.458280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.441309Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"a189b8e2-eb8f-46fe-a82c-cbcb61a51412","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.469442Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:0a33345fb076fd18c7d2a62001c2f0d8ae58ee0bebdf4e77e18570628dad0f3b","observation_id":"48cd2450-3086-47aa-a10e-d035cfc5ca01","resolution":{"observed_at":"2026-08-16T05:01:16.445830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-16T14:39:46.784112Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-16T05:01:15.473305Z","title":"Seed-bench- 2: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.473305Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:81360a1d44c7cf4a1e753756c75042520097c126aa0648e329df6495b7fa9096","observation_id":"8e79c4fc-deb5-4c2f-a9a2-0ed26d45b394","resolution":{"observed_at":"2026-08-16T05:01:15.473305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-16T13:57:47.881881Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-16T05:01:15.477616Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.477616Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:f36c2ee898092bb7f877357cf966d81c01ddeddd3d4f5549c402992c55fec0c5","observation_id":"1a1bcee3-8c27-4888-bb25-b0af90329a1c","resolution":{"observed_at":"2026-08-16T05:01:15.477616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.481951Z","title":"Tabpedia: Towards comprehensive visual table understanding with concept synergy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.481951Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:8335bc9861ffc750622f2d831360352510217db1d3b35a96a205045a89a8d76f","observation_id":"2df5237b-a74d-40ec-95c3-9d1bc6fc21a3","resolution":{"observed_at":"2026-08-16T05:01:15.481951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.419509Z","title":"Docpe- dia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding","venue":null,"work_id":"a5c99655-e512-4e96-97cd-82844cb86ab7","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.485466Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:8b8f161a816097f680f0c1c28676d05127ccbb8df40206e36f3993c2e7d76cfa","observation_id":"2b21b38a-f6e9-47bc-bc22-727fa902dfad","resolution":{"observed_at":"2026-08-16T05:01:16.423965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.489725Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.489725Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:c25df872ddebbe984de1c4f91c7fbbb17b96b633ec8ab68267ad463125f4ba5a","observation_id":"26599e1e-d285-4baa-8b40-64cf9c1f40d5","resolution":{"observed_at":"2026-08-16T05:01:15.489725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.397288Z","title":"DuReadervis: A Chinese dataset for open-domain document visual question answering","venue":null,"work_id":"7d5f1a19-7752-4519-8097-01ff28ac8134","year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.493483Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:db34daebadd45ba102592eef26892b8035ae8c4100b7f7de23404dc34e141e73","observation_id":"1d018a30-731c-4ad5-806b-4caf62dc6fec","resolution":{"observed_at":"2026-08-16T05:01:16.401634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.383526Z","title":"Visualmrc: Machine reading comprehension on document images","venue":null,"work_id":"fec14cc4-27bf-4805-beb6-bd0d0dbdffa7","year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.497172Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:e9651b5ce315335b7abcb890aedf90069d46c080d37488ce30d922a0042b3811","observation_id":"0f36c01c-7d62-4a05-9aac-48fcb308fe91","resolution":{"observed_at":"2026-08-16T05:01:16.388003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.370128Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"22c56a90-f4fe-460b-8add-f4ed61b3cc48","year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.500744Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:35fec17fe7ea6d887c4dd2374676d5a9112bae559af9e0c6208da6b1bd1e90ce","observation_id":"0de884fa-16c3-4040-b4a5-9b91c7146d85","resolution":{"observed_at":"2026-08-16T05:01:16.374518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.355617Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning, 2024","venue":null,"work_id":"ef95e710-ff2f-4f41-b51f-bb564dd21b46","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.504674Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:a593c2c150f441d4af154f693999166eef938cc935f5635e009b13940b42c412","observation_id":"33600cd0-fc4c-484c-9ec2-b8a8b6a34403","resolution":{"observed_at":"2026-08-16T05:01:16.360061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.513802Z","title":"Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.513802Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:ae2d435401dade40f968433f339efb2393dc183f7d8f6de928f7442bf2171137","observation_id":"63f34b33-3058-4466-ac11-71e449726465","resolution":{"observed_at":"2026-08-16T05:01:15.513802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-08-14T02:54:31.558222Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-16T05:01:15.517859Z","title":"Mineru: An open-source solution for precise document content extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.517859Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:5b12b0335c839aa042083f37fd1ace7cd81884d96a6914d6bf048dee11a1804d","observation_id":"10daf408-24a2-4a62-8ef9-73f593113801","resolution":{"observed_at":"2026-08-16T05:01:15.517859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-16T05:01:15.522410Z","title":"Nougat: Neural optical under- standing for academic documents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.522410Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:1da693da1be415090cbe761b4096154244b3c294533bea016f2d73a7cc92b586","observation_id":"d75fb58a-1bd2-48e8-b3bc-ae8e248d874a","resolution":{"observed_at":"2026-08-16T05:01:15.522410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03144","last_updated":"2021-10-12T13:36:26Z","snapshot_observed_at":"2026-08-16T17:58:18.217245Z","submitted_at":"2021-09-07T15:24:40Z","title":"PP-OCRv2: Bag of Tricks for Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03144","snapshot_observed_at":"2026-08-16T05:01:15.526740Z","title":"Pp-ocrv2: Bag of tricks for ultra lightweight ocr system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.526740Z"},"links":{"cited_paper":"/paper/2109.03144","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:6dace992bd7d3d9a9efe5091ed52a2590294458642268206cd95c2d9a9d31ae1","observation_id":"1712c746-288c-478f-ac47-77c4499f7029","resolution":{"observed_at":"2026-08-16T05:01:15.526740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.333061Z","title":"Publaynet: largest dataset ever for document layout analysis","venue":null,"work_id":"da56791e-a74c-4e17-aa41-106b2f06ebc4","year":2019},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.531155Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:a93fb71ee483acf8fdb18945d86321c448509342ec5496926397a9ad89f371d5","observation_id":"41a14685-2ba2-4da9-9981-83eadea739b0","resolution":{"observed_at":"2026-08-16T05:01:16.337991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.319974Z","title":"Detecting text in natural image with connectionist text proposal network","venue":null,"work_id":"7512c5b8-5b4d-4982-bc64-983940958bfa","year":2016},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.535073Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:cbeab39ab9d5b8171ab1c478931b9280001ff9095fd1e53a42f8567753278e85","observation_id":"8cd6ea47-e0cc-4c0b-95f2-c45de9725e72","resolution":{"observed_at":"2026-08-16T05:01:16.324591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.307357Z","title":"Textboxes: A fast text detector with a single deep neural network","venue":null,"work_id":"5d581d28-acee-43cf-bac5-f078f03e73d2","year":2017},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.539314Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:7f7c8f04079ef1c73bea3a6b09dd79dff57bdcad544090af1cdc940a53913f56","observation_id":"ffd37e88-9139-4325-a946-9233d44b18d3","resolution":{"observed_at":"2026-08-16T05:01:16.311428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.294894Z","title":"East: An efficient and accurate scene text detector","venue":null,"work_id":"b3463576-1c7a-4e6f-b4e7-5826c1b4f7cf","year":2017},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.543681Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:e0704452c963f340ad1d2db745061e80e911f04f7ed4251c2bd431fcb57aceed","observation_id":"d82e9867-613e-4331-8d38-e1a3b6593bf2","resolution":{"observed_at":"2026-08-16T05:01:16.298976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.282576Z","title":"Curved scene text detection via transverse and longitudinal sequence connection","venue":null,"work_id":"60509c5e-2777-499a-811a-91781842bbf5","year":2019},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.548442Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:bb0f0bf31afded8829f5d49d62679d116833a4b80f094446e7e90883bbdcb817","observation_id":"b9e2be46-9cc0-4de2-aab5-9ba6f40745cb","resolution":{"observed_at":"2026-08-16T05:01:16.286625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.553128Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.553128Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:0501fd1245101eaab139659dd64ba0589ec26657e03a5c6d865e6500c971463a","observation_id":"9ec5d3f4-1911-47c7-82e1-7fd7155a6019","resolution":{"observed_at":"2026-08-16T05:01:15.553128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.260875Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":"866452b1-d81e-4b5f-b726-27b9deb31cd9","year":2006},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.557387Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:bffdeae5860e10e73e68dc7295dd72fa34364ef6e73023530bff40f7858b221f","observation_id":"2d3e4c22-bd05-493e-95c0-05731349d10b","resolution":{"observed_at":"2026-08-16T05:01:16.265383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.247736Z","title":"Trocr: Transformer-based optical character recognition with pre-trained models","venue":null,"work_id":"68d3ecad-eac6-427a-bffe-792649797c1b","year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.561367Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:9859798921d2712fbcc40c3b2cbebbc97a1b2f533aa7f67f0bc99adc8d76e83d","observation_id":"8c6dc4d6-f1b3-4d83-8bad-d3bd2926a0e7","resolution":{"observed_at":"2026-08-16T05:01:16.251990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.233190Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model, 2024","venue":null,"work_id":"e76942c6-0c78-4018-9b91-08a34ca1898b","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.565654Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:364877ae6ac9e222bca68fe39b1d6b0164d74fb839ce8380b5b8b2cdf83ccb8b","observation_id":"c2e2f2d9-094c-4e41-b180-932d07ac1f6f","resolution":{"observed_at":"2026-08-16T05:01:16.238943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.569895Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.569895Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:d7c004e1dbdc5fc38ad829de5cc1332c020e765b71d833ff1c4abc78e79985c6","observation_id":"8996b0e3-6429-4831-a4a8-c789934f1974","resolution":{"observed_at":"2026-08-16T05:01:15.569895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-16T14:36:01.153196Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-16T05:01:15.574129Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.574129Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:3a71e114695c7a7317ac1b2c5181a123b3acf2abe02e7e5c4e54901cd702c29d","observation_id":"d0488b0b-c210-491b-993b-17f12a1606ed","resolution":{"observed_at":"2026-08-16T05:01:15.574129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-16T15:18:52.045487Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-16T05:01:15.578722Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.578722Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:28e28c729bb1e932484a2ea5b029d759138f2599a1bcc26889f1ba4abadcf426","observation_id":"922212e8-41a2-47e2-8247-2eb451015deb","resolution":{"observed_at":"2026-08-16T05:01:15.578722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-16T05:01:15.583499Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.583499Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:2dbf0c3f9a3532c8f53ec5296c832f42d5f6717effe34848755de8279250f932","observation_id":"e0997066-b011-4465-9296-49893f0d18e6","resolution":{"observed_at":"2026-08-16T05:01:15.583499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-16T14:11:58.831714Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-16T05:01:15.588006Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.588006Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:cf87d425f1320ab16e976381407a631c8b1798ba368a6f54cefbebfb81a485d2","observation_id":"1d82a257-955e-4ba6-9d4a-90268be311fe","resolution":{"observed_at":"2026-08-16T05:01:15.588006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14295","last_updated":"2024-05-23T08:15:49Z","snapshot_observed_at":"2026-08-16T13:50:19.823615Z","submitted_at":"2024-05-23T08:15:49Z","title":"Focus Anywhere for Fine-grained Multi-page Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14295","snapshot_observed_at":"2026-08-16T05:01:15.592340Z","title":"Focus anywhere for fine-grained multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.592340Z"},"links":{"cited_paper":"/paper/2405.14295","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:56ab56a623a625ceaadcf2ca277b3ac4cf938554b1a028735fb35bba28fc8119","observation_id":"a886ceed-1c2f-4996-9721-b5f8b65c349d","resolution":{"observed_at":"2026-08-16T05:01:15.592340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.211901Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"0d0be491-1dae-4dc1-bc3a-3f9fbe04a3ec","year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.596918Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:618725c0f4f6bf2f56fb4877f43adf754d57ae142c67560640617d529aa70bc3","observation_id":"5d83cfa6-9e42-4c5d-956a-efbde08c06dc","resolution":{"observed_at":"2026-08-16T05:01:16.216221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-16T14:54:06.604406Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-16T05:01:15.600852Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.600852Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:7c328cf0d0ce1732d57d29937f78321b3a85ccf2099cd7fee5f87d70e05970de","observation_id":"797929cd-e1e4-421a-ba37-31d011647556","resolution":{"observed_at":"2026-08-16T05:01:15.600852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.198872Z","title":"Lamol: Language modeling for lifelong language learning","venue":null,"work_id":"adf3dbf9-bd57-49e7-9d47-0b72158dc775","year":2020},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.606072Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:f10a71de1942b9172ed2a23d0b734b54a2a7c999cb7e6c9d6b6260b4fbd0cecf","observation_id":"e95e7813-7efa-4938-bf55-3a8a040aea4a","resolution":{"observed_at":"2026-08-16T05:01:16.203170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.185188Z","title":"Rational LAMOL: A rationale-based lifelong learning framework","venue":null,"work_id":"800f9d56-78fc-4f05-9505-adf6e1bd3807","year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.610475Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:54398da40551d435f75c0f0067a59ad997f0aaa13e047b86ac50f8a31a7c6234","observation_id":"c54b0be1-acc4-4cef-9d30-0429b1f42896","resolution":{"observed_at":"2026-08-16T05:01:16.189763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.171310Z","title":"Loramoe: Alleviating world knowledge forgetting in large language models via moe-style plugin","venue":null,"work_id":"dc128082-8899-4056-b147-533ce4d831f6","year":1932},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.614501Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:8b24cdfa3121ce5088cb4d8d3f83d8ce9cd0dc0a67cd1f9c36f3d0b75e6630fe","observation_id":"82ee7177-343a-4e43-a0c8-b7b7b7adc093","resolution":{"observed_at":"2026-08-16T05:01:16.176505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12314","last_updated":"2023-01-29T00:17:38Z","snapshot_observed_at":"2026-08-16T15:59:28.676920Z","submitted_at":"2023-01-29T00:17:38Z","title":"Progressive Prompts: Continual Learning for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12314","snapshot_observed_at":"2026-08-16T05:01:15.618680Z","title":"Progressive prompts: Continual learning for language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.618680Z"},"links":{"cited_paper":"/paper/2301.12314","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:376d1c1c4158d3e237786f2afb5a8bd5eb524f29a0f9fab58ee1101d1b525f86","observation_id":"81af4035-99a5-4568-aa02-a9478c71ba96","resolution":{"observed_at":"2026-08-16T05:01:15.618680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16559","last_updated":"2023-05-26T00:57:43Z","snapshot_observed_at":"2026-08-17T17:00:59.936656Z","submitted_at":"2023-05-26T00:57:43Z","title":"Teamwork Is Not Always Good: An Empirical Study of Classifier Drift in Class-incremental Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16559","snapshot_observed_at":"2026-08-16T05:01:15.622890Z","title":"Teamwork is not always good: An empirical study of classifier drift in class-incremental information extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.622890Z"},"links":{"cited_paper":"/paper/2305.16559","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:b6caa14a48a07d56851a2a65de605eabe69eb075ec4a46bfe2894c0f6c538354","observation_id":"173fb86d-f4b2-44c5-80fb-fd64ffbcf65b","resolution":{"observed_at":"2026-08-16T05:01:15.622890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.626804Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.626804Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:c9824f1a714a1868a729f4583bd1d5efc080cf60cf1efc7d273818c96d55022f","observation_id":"68db0b5c-fd5e-40ed-87c2-ccfe3df8d7bd","resolution":{"observed_at":"2026-08-16T05:01:15.626804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.149393Z","title":"Continual sequence generation with adaptive compositional modules","venue":null,"work_id":"acc4fd6d-3190-46ca-8a43-5ef165966c8d","year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.631198Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:df23396ce928699c82d06e4a0db36c8e9e76b69154121d68ac31d08ce9c77833","observation_id":"6d2a9d72-d308-4c3d-aeae-538066b61641","resolution":{"observed_at":"2026-08-16T05:01:16.154042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.635375Z","title":"Preserving in-context learning ability in large language model fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.635375Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:81ffea344a815b819ec20994e0c75980c24cda1a4f27bcc69023b2a511ff44b7","observation_id":"64ae4ae8-111b-4118-8b71-3ee8fb3e737a","resolution":{"observed_at":"2026-08-16T05:01:15.635375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.125970Z","title":"Editing models with task arithmetic","venue":null,"work_id":"39ef3425-3ddd-4f74-a837-1912095402df","year":2023},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.639331Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:9a63a8d607ea944d3016458af1b036490abd7015d41a2248d543a1b4bee36e98","observation_id":"03360ac3-5c97-4f2b-be02-6f313733a82d","resolution":{"observed_at":"2026-08-16T05:01:16.130337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.111813Z","title":"Gradient projection memory for continual learning","venue":null,"work_id":"0b7ca951-5bdf-4ef8-a453-c5ec69167b44","year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.643336Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:77becc47e2cd638f9eadf08375d16db7fdd47475982b6f4c101f78b89d0d1679","observation_id":"d36672bf-a3f0-41d6-8f2a-af23e095b6ec","resolution":{"observed_at":"2026-08-16T05:01:16.116121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.097703Z","title":"Visualsimpleqa: A benchmark for decoupled evaluation of large vision-language models in fact-seeking question answering, 2025","venue":null,"work_id":"b4073429-5941-40e7-90a7-9fc7521f4ca5","year":2025},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.647599Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:3bb765ba0cc10d83cc127105079feac387ed3aac5bcffbde1f05e8979cdb3a8e","observation_id":"2c79a614-6c97-4c64-ba44-130819d5fd74","resolution":{"observed_at":"2026-08-16T05:01:16.102649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.652164Z","title":"Binary codes capable of correcting deletions, insertions, and reversals","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.652164Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:244b8fbebc1e8c10511aedaba42260b6567a44be83bf8d9fe047983bf132a4c7","observation_id":"bdc4997a-bc58-43a5-b345-6991e070fa4a","resolution":{"observed_at":"2026-08-16T05:01:15.652164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-16T05:01:15.656654Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.656654Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:3b779ffd0be5d34fa562546ca6d6a37c250f7513d4f3dcb64874b17d8e690784","observation_id":"d4a37fe8-b0cd-4f5a-b8d4-e235d78f3865","resolution":{"observed_at":"2026-08-16T05:01:15.656654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-16T05:01:15.661099Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.661099Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:76871d6afb2d49f1f798e6597a2b6916df477ed7499ab9971ff07b77f7f44097","observation_id":"19630431-9e97-45b1-9486-d0f27d7a6590","resolution":{"observed_at":"2026-08-16T05:01:15.661099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.665658Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.665658Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:f765f1abdfef464d2e97f7d083ee5979a5e69fd62e1cf65202270f4a9e56589d","observation_id":"a313a46e-512d-4f45-b274-2b209bb8c639","resolution":{"observed_at":"2026-08-16T05:01:15.665658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.065383Z","title":"Ai2d-rst: a multimodal corpus of 1000 primary school science diagrams","venue":null,"work_id":"b11e2882-62d1-49fc-a4fd-d8b5439d1db7","year":2021},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.669573Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:f26e5163b15e062f375eba8a4c73b3daf1cde5da2bbed93b0b66f4a0965ce0bc","observation_id":"1235ce46-603f-4cfe-a02d-550ffdccf97b","resolution":{"observed_at":"2026-08-16T05:01:16.069875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.674358Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.674358Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:e90573d22f37192f55bd988e45334bd847f418395f7e3f3c3d8be2cf79df555e","observation_id":"3f79ab19-d454-45af-825d-ef10ac8387e1","resolution":{"observed_at":"2026-08-16T05:01:15.674358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.678427Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.678427Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:cf49b25e7e2b0990bd9f74e5838d5c01290be60380b5dabe1091ed50ee6f8d28","observation_id":"0fd1fb34-22b1-47fb-8f26-ddfeff0de97c","resolution":{"observed_at":"2026-08-16T05:01:15.678427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:15.682362Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.682362Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:349ed6091858379ede77f95da294fa7c44e04952a59f61b8c4dad718c6a60e3c","observation_id":"91f25037-2c36-4fc1-ac05-3854adee8f7c","resolution":{"observed_at":"2026-08-16T05:01:15.682362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:01:16.022086Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":"c290a8f4-e589-4c76-a3ac-1ffbcbb0c93c","year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.686867Z"},"links":{"citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:ffca7b471c18b33463e67c8cc65f0cf12f6ea29c436244a68f0ed385322a9e94","observation_id":"c0b50e32-06a3-45b4-9e96-a10264b63551","resolution":{"observed_at":"2026-08-16T05:01:16.028544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T05:01:15.691092Z","title":"Author Information\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:01:15.691092Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.00063"},"observation_digest":"sha256:968e1fac0512474534947a9d5f526872f137e6ca707a7536794f8d0dd9ee3bb9","observation_id":"1bd3d5dc-95fc-4730-8710-cda898b85a6b","resolution":{"observed_at":"2026-08-16T05:01:15.691092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00063","last_updated":"2025-05-22T05:16:26Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T04:52:29.750881Z","submitted_at":"2025-04-30T15:46:46Z","title":"GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 2 inbound Pith citation observations for arXiv:2505.00063."}