{"as_of":"2026-08-05T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da9f6013846dfaf2f1755ff40d106ec968899684ee9d2f889f7e8695c761c84f","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T10:34:21.033424Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.15118/citation-record","integrity":"/paper/2603.15118/integrity","json":"/paper/2603.15118/citation-record.json","paper":"/paper/2603.15118"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-VL technical report","venue":null,"work_id":"7b7383cd-c9a7-40bf-a9b6-bfe717a971fe","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:dca60fdcdcf3960d80c4931289fa82bd0019590407acdf1102de76ca84751b68","observation_id":"6ad9980c-87cf-4bda-ba42-3e7578c0f03b","resolution":{"observed_at":"2026-05-15T10:35:28.159707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"So-bench: A structural output evaluation of multimodal llms","venue":null,"work_id":"8623740d-c2f7-4245-abbc-b92bdede9c2a","year":2026},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:1f2bc76edc5b92decf3afd6792f538434934de2e6742a17e8153f8db43461ed7","observation_id":"cffe2b4d-f93e-4825-8c9e-692f2993f27d","resolution":{"observed_at":"2026-05-15T10:35:27.445604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12247","doi":"10.48550/arxiv.2602.12247","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ExtractBench: A benchmark and evalu- ation methodology for complex structured extraction","venue":"Open MIND","work_id":"cd272d1e-9bf4-473d-9f19-feae946b73e6","year":2026},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:da26d2f1443fdda4eebf0380b6a392796d0def034664f076ebe93727d4345678","observation_id":"0cdfcef6-42dd-482b-9edd-bed48ef1c315","resolution":{"observed_at":"2026-05-15T10:35:27.420029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:46d4c683b7d6e0739546338edcbb343cd3bba957daf0e46c1925f02633778ac2","observation_id":"179f8895-3953-49a7-a276-a064a88d6c40","resolution":{"observed_at":"2026-05-15T10:35:27.425028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10868","last_updated":"2025-02-27T15:37:21Z","snapshot_observed_at":"2026-07-06T20:22:54.817573Z","submitted_at":"2025-01-18T20:26:00Z","title":"JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models","version":3},"cited_work":{"arxiv_id":"2501.10868","doi":"10.48550/arxiv.2501.10868","metadata_source":"pith","pith_arxiv_id":"2501.10868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jsonschemabench: A rigorous benchmark of structured outputs for language models","venue":"cs.CL","work_id":"0a01531a-03bb-463b-8bec-3777fe5a120b","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"cited_paper":"/paper/2501.10868","citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:dbd9c2f0e970be3cce062121224aea5df592b3dea7dddd09c3f87977d16510ab","observation_id":"a5a0d67a-5b89-4e0c-abd2-e28059c898bf","resolution":{"observed_at":"2026-05-15T10:35:27.414369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5: A new family of highly capable multimodal models","venue":null,"work_id":"bf96c351-51d6-478d-837d-fd51b5d8a577","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:0b832a2e41a7446a02df31bbdc7cfdabd46ce153e5d38e5c9b53eb0ab62ab11b","observation_id":"e982eef9-5206-4a15-a018-300faaa05ca3","resolution":{"observed_at":"2026-05-15T10:35:28.161620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2O-VL mississippi","venue":null,"work_id":"3c48608f-c08b-4f8a-a863-f8058e3968d9","year":null},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:dbe6b24ed26372852444a659c1f5ec54a359d6874c151a0587ba991941fefc82","observation_id":"92a79c60-6e8b-4068-9333-fe815981ac04","resolution":{"observed_at":"2026-05-15T10:35:28.165359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayoutLMv3: Pre-training for document AI with uni- fied text and image masking","venue":null,"work_id":"34a017f1-8485-46eb-9ed7-c8bd6d742c5b","year":2022},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:dcf151a2fc533ab8335ccbbb9ad2e5815a543f377db2fcd3bbf354a90825a021","observation_id":"b2fa3e21-8463-4984-a86b-e5f4d1aa9303","resolution":{"observed_at":"2026-05-15T10:35:28.135275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1325639-0a65-4c81-b690-40a1c3554eb5","year":2019},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:2b89ff3a646fcf4c71a5638e309d2bcf972f15cbf73369325a14875e2bcdc56a","observation_id":"4acb5945-8059-4545-81ec-e9fc985a8975","resolution":{"observed_at":"2026-05-15T10:35:28.137104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4o system card","venue":null,"work_id":"1e145998-34f1-4c3d-880a-a8b4b23444ec","year":2024},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:9870c628b2c290521716cc96b2b4da4c508ef02f7f4032efb5d23272f1af11df","observation_id":"fa70b0cc-aba8-4594-bacf-d2667433626f","resolution":{"observed_at":"2026-05-15T10:35:28.154084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FUNSD: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"42768139-485b-4ba7-9033-0b3c176bb112","year":2019},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:19768dd0dc9d8be00907318e3bcb7e246dbbc5ba8d6eba5e7626b84fd2d0928c","observation_id":"9e587e8a-819c-469d-96ad-4431396e2a69","resolution":{"observed_at":"2026-05-15T10:35:28.133240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Donut: Doc- ument understanding transformer without OCR","venue":null,"work_id":"21b4af17-0e8b-402d-b8d5-69514bbabc92","year":2022},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:71cfe58c55f24aec76cbd96f8a644772a67a5a8d7f504471e778f01624c95291","observation_id":"21c99078-50b3-4866-8ffe-803decac8f3d","resolution":{"observed_at":"2026-05-15T10:35:28.155921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"1cd00492-fb20-49b9-956e-bf7284d20417","year":2023},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:ecf78f6ce077ddbcd102325ab6f10a1944b15c2e4605b423d539fad51bfa11a8","observation_id":"c785d5db-33cd-4c4b-9c13-670dfc349b0f","resolution":{"observed_at":"2026-05-15T10:35:28.150359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17887","last_updated":"2025-01-27T19:40:00Z","snapshot_observed_at":"2026-07-30T22:36:20.561157Z","submitted_at":"2025-01-27T19:40:00Z","title":"Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion","version":1},"cited_work":{"arxiv_id":"2501.17887","doi":"10.48550/arxiv.2501.17887","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Docling: An efficient open- source toolkit for ai-driven document conversion","venue":"ArXiv.org","work_id":"d139a974-3108-4df8-89d1-c9c1e87ecfd4","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"cited_paper":"/paper/2501.17887","citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:8931ba27e57f26a9a676af73c165592a601d6119638002e23a63427b16fef6e2","observation_id":"336fa79f-c0e9-4990-b115-c7019b1a003a","resolution":{"observed_at":"2026-05-15T10:35:27.430189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayTextLLM: A textual layout percep- tion model for visually-rich document understanding","venue":null,"work_id":"9b1776bc-a338-4b1e-88e9-3df0cc0158a7","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:57b916d74bb40305597530823f9286544c1505bbbceaefd5f4a0186ebbd2bebd","observation_id":"64fb9e01-59a4-43de-a415-df65569f04ae","resolution":{"observed_at":"2026-05-15T10:35:28.152322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 4: Maverick and scout","venue":null,"work_id":"d0613ff7-b8de-49b0-bf0a-b7cdb0997e1e","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:797f9534e8043d4e964510ccaf5b7bddd4cea6f9461d85bb48aea83db39026cb","observation_id":"3c948b04-e2d4-4d60-a074-c3772d352e1e","resolution":{"observed_at":"2026-05-15T10:35:28.146657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mistral small and ministral","venue":null,"work_id":"c6c60111-caaa-4299-97a5-cc972e56995e","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:0e34b94d69489b8d385ea57ef7d0831b08520f8420baebce10f73e1de4173424","observation_id":"9084fece-81a6-44bd-862b-f46124df0404","resolution":{"observed_at":"2026-05-15T10:35:28.140979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NuExtract 2.0: A specialized model for structured extraction","venue":null,"work_id":"7e50cebf-c2f6-4faf-a786-9baf193b5603","year":2024},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:7d496e7a8eb2b4b8bb280c1e7b33ed1d11d8b061893282bc0c6cb29c70234630","observation_id":"c5a2ad45-e71f-46aa-b5e5-114bfb83ae77","resolution":{"observed_at":"2026-05-15T10:35:28.169141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniDocBench: Benchmarking diverse PDF document parsing with comprehensive annotations","venue":null,"work_id":"2a2ee8ca-a144-459f-b415-89fab4a7b0e9","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:63cf2087d1b7ca6c137bdb6eff95c39e0d8fec474048df8dbb3428dd7385292f","observation_id":"9846f4ba-040a-4114-b615-72742a40ca4f","resolution":{"observed_at":"2026-05-15T10:35:28.171149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CORD: A con- solidated receipt dataset for post-OCR parsing","venue":null,"work_id":"eaad13c9-31a6-4ddd-ae81-b3f654ae084b","year":2019},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:7a9d44ade2b3b385da9627fed34bc013bc9cc5b926e4b2bbf3fd33c970900998","observation_id":"a049f000-fa77-45a7-9e31-ee1b143227e4","resolution":{"observed_at":"2026-05-15T10:35:28.148589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLMWhisperer: Layout-preserving text extraction for LLMs","venue":null,"work_id":"9d345901-ecf9-46c7-b750-39c128902812","year":2024},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:0f2027bf39147e6a92833a6ea5c8b2a59ae4a77266d1703819c3ffca08f42dd2","observation_id":"10e21ea5-b0b6-41c7-a66d-9241691aff83","resolution":{"observed_at":"2026-05-15T10:35:28.139170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocILE benchmark for document information localization and extraction","venue":null,"work_id":"eb7dac89-d685-4b49-9729-a9fbef9fdeba","year":2023},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:3db61545a40e14c0a7a24c6aa96f76328e51d6ab271a23dd036c6a5118486b0d","observation_id":"9fdf5a07-6aa2-4a42-aed6-ff4baf79d8c7","resolution":{"observed_at":"2026-05-15T10:35:28.142868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LiLT: A sim- ple yet effective language-independent layout transformer for structured document understanding","venue":null,"work_id":"4c47144b-432a-4790-86bb-407afebb7563","year":2022},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:64b20cbf9a323c1ddd7e51f6dca77a54c3951894685b9d06944f4d44527c9183","observation_id":"f918b11e-c8c0-4f0e-80e9-0fbb584862ee","resolution":{"observed_at":"2026-05-15T10:35:28.144784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:aa0979af4fe3b71c4e6044abe7e79b1cf639357d66d3fe113bde855f87ba67a7","observation_id":"af81ae58-b04f-4684-8bb3-55701c95be5b","resolution":{"observed_at":"2026-05-15T10:35:27.440400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:49bcda1b69ae880d2c3b268f25a2e730966b303ccc04a4a344de13ab19876938","observation_id":"de4c98f8-cac6-4f19-b6b3-89b89b492be9","resolution":{"observed_at":"2026-05-15T10:35:27.435589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VRDU: A benchmark for visually-rich document under- standing","venue":null,"work_id":"19600e93-c791-4fec-8c93-1442f4f4134b","year":2023},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:704701ebfb26b1a731ef397e583ede18b62ede626ea082e91e80a52e228a9f0b","observation_id":"8f738e47-96cf-4f61-8bd9-51e66e39d1c9","resolution":{"observed_at":"2026-05-15T10:35:28.157879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayoutLM: Pre-training of text and layout for document image understanding","venue":null,"work_id":"bc0ea330-71cf-4b7e-9d9a-bfe31e7ad06e","year":2020},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:9f52aef3bb5c16c6e0d070922061dd3395222af2ddecc9ed6caa9bf451dd1847","observation_id":"9e9ee6e2-3e54-4854-9b85-8ec9c0d512d3","resolution":{"observed_at":"2026-05-15T10:35:28.173016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayoutLMv2: Multi-modal pre- training for visually-rich document understanding","venue":null,"work_id":"6703c7cb-7271-44be-9238-dca5f6aa35de","year":2021},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:bf9a1cf81eeb0742dea905660328ae2b796bf199eb02355cbe45723269ddadf6","observation_id":"57bb642c-a190-4e37-bd04-cd7cb34168a0","resolution":{"observed_at":"2026-05-15T10:35:28.167323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"type\": \"object","venue":null,"work_id":"b614691f-d296-48e2-ae6b-9b68433927ba","year":2024},"citing_paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T10:34:21.033424Z"},"links":{"citing_paper":"/paper/2603.15118"},"observation_digest":"sha256:996a559e6e44ab5a76aa84ffdcd6edda16a5091a6f491954332eb813cd975f74","observation_id":"9c39ca75-f44c-4356-97b6-05ae9791d3f1","resolution":{"observed_at":"2026-05-15T10:35:28.163541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.15118","last_updated":"2026-04-09T08:31:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T22:56:08.717245Z","submitted_at":"2026-03-16T11:15:56Z","title":"VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":21},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2603.15118."}