{"as_of":"2026-08-18T19:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95d3fd535a357ebb9b0d62097280c369f01a4401a0e7addc07acb9c58a8a1794","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:03:57.361625Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07836/citation-record","integrity":"/paper/2607.07836/integrity","json":"/paper/2607.07836/citation-record.json","paper":"/paper/2607.07836"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-15T07:34:12.195990Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-02T08:03:48.857432Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:48.857432Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:527628f750edcb9209194e83ebeb38408434d627fb8b8d41ca771f4304e2ecb0","observation_id":"a5f84112-a861-4163-80f5-bffd6f2b7a51","resolution":{"observed_at":"2026-08-02T08:03:48.857432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:48.900506Z","title":"Paddleocr-vl: Boosting multilingual document parsing via a 0.9 b ultra-compact vision-language model.arXiv preprint arXiv:2510.14528, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:48.900506Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:dd7e3f59c10d1853ba8b0b00f04671f7919d873b90eb51b51e43bad31de82f96","observation_id":"b92a1733-0bb3-4a9c-b5c1-46ac6c1aa184","resolution":{"observed_at":"2026-08-02T08:03:48.900506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-08-17T02:37:33.939393Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-02T08:03:48.944742Z","title":"Deepseek-ocr: Contexts optical compression.arXiv preprint arXiv:2510.18234, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:48.944742Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f77cca53643bd77ed853a582ba984aab8433b22576b9359ae761f41be50e7521","observation_id":"9c457c94-a0c1-4383-ab34-061c5f6e8b67","resolution":{"observed_at":"2026-08-02T08:03:48.944742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.035787Z","title":"Infinity parser: Layout aware reinforcement learning for scanned document parsing.arXiv preprint arXiv:2506.03197, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.035787Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:fa41d73d5f630afab3598d6d4a56a2155c3f5dd7fd10d74426e00428ec4f9475","observation_id":"02d004b2-5bbd-4cb0-996e-b60f89f60d96","resolution":{"observed_at":"2026-08-02T08:03:49.035787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.112188Z","title":"Logics-parsing technical report.arXiv preprint arXiv:2509.19760, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.112188Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:cc030339bb9dc321f7260b846da42f497ea77e3f365c94d50b83c4b86a347479","observation_id":"769c8a12-4663-495d-9dd2-ed2851fc016a","resolution":{"observed_at":"2026-08-02T08:03:49.112188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.239885Z","title":"olmocr 2: Unit test rewards for document ocr.arXiv preprint arXiv:2510.19817, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.239885Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:405d497ee93a9071f019921663c39f0c03d990ca8bde66ab087fb6cf6c57dff4","observation_id":"ef713525-0ace-4bd8-b40b-5b82952c4da6","resolution":{"observed_at":"2026-08-02T08:03:49.239885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.284104Z","title":"dots.ocr: Multilingual document layout parsing in a single vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.284104Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:950a7be16bdbb7b1d1c0632e9a42599e94d5b6d88321caa75ce59df0c6c7c8ac","observation_id":"d42566a5-4d8e-495f-a82d-553505f39255","resolution":{"observed_at":"2026-08-02T08:03:49.284104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.400359Z","title":"Multimodal ocr: Parse anything from documents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.400359Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:44694e313cad98158580d6d9374632a2e67bb3f7988a32120c585253aa072f7d","observation_id":"1c2fb3ff-a484-4085-ab35-9e8dd7133e30","resolution":{"observed_at":"2026-08-02T08:03:49.400359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.454268Z","title":"Deepseek-ocr 2: Visual causal flow.arXiv preprint arXiv:2601.20552, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.454268Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:7c69351a27ae6652ce6cd116ecab95c7772b736eadfc9c44a70df33092e2b497","observation_id":"4c4fe5e7-0b56-4e96-887e-b4af984af090","resolution":{"observed_at":"2026-08-02T08:03:49.454268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.597847Z","title":"Table2latex-rl: High-fidelity latex code generation from table images via reinforced multimodal language models.arXiv preprint arXiv:2509.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.597847Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:8bd81aebb08a908e0edb468b4461e13d262e00b8b8d54505e555fb012df8b707","observation_id":"af5e3f2b-eb23-440f-9eb2-1a0dbd8cae21","resolution":{"observed_at":"2026-08-02T08:03:49.597847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.687363Z","title":"TextDiffuser: Diffusion models as text painters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.687363Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:967057775d76b4c43dcaf99c8bc80bca002fc81e6f2c74c546cfa6b42c5158f8","observation_id":"a7a470e2-167f-47d6-bd9f-c463aee03173","resolution":{"observed_at":"2026-08-02T08:03:49.687363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.761509Z","title":"AnyText: Multilingual visual text generation and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.761509Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:4dffb088a01004a357e52f64f872e11d64ff6718afd79022bec9dd37f82751a2","observation_id":"26565d77-03a6-429b-a1a7-07cd1c3194b9","resolution":{"observed_at":"2026-08-02T08:03:49.761509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.803445Z","title":"TableFormer: Table structure understanding with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.803445Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:def42d5051d057fae580905ff6732468abec1a7b3dd01f56d909d223b3d6ac87","observation_id":"4ba53646-476a-4ba3-9912-de9c1aef1530","resolution":{"observed_at":"2026-08-02T08:03:49.803445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.809178Z","title":"Scaling text-rich image understanding via code-guided synthetic multimodal data generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.809178Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:fc10cad097f5356165d9d04819b00e87ebfd1b2e4f2df80794770999f48c97d9","observation_id":"bfb25b90-e5fd-45f9-a154-849c71335ee2","resolution":{"observed_at":"2026-08-02T08:03:49.809178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.882315Z","title":"DECIMER: Towards deep learning for chemical image recognition.Journal of Cheminformatics, 12(1):65, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.882315Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f4d122d81d3d71206ca95547aadca257a74bf397b2428777ac27a35a1bb745f6","observation_id":"5c682424-8138-4638-8428-c585f75201a9","resolution":{"observed_at":"2026-08-02T08:03:49.882315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:49.944744Z","title":"Nougat: Neural optical understanding for academic documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:49.944744Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f77d85f82970e6a3f30eb53dedcda6a057c366bea443110adf4e7ecc02f59563","observation_id":"4e10354b-5cd7-4e35-8493-f9aea5357628","resolution":{"observed_at":"2026-08-02T08:03:49.944744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.087121Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.087121Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:5183de551b6bfd94e76b132b3b4c1c4c3f7d548e47d566909eb415aed14efec8","observation_id":"9cbf145c-7833-4fa9-b577-249e3ab1fce5","resolution":{"observed_at":"2026-08-02T08:03:50.087121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.205375Z","title":"Wikimedia downloads","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.205375Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f81a34527f44821e2206b1e40aa01304c1976de0c463271d49c954e5a09bdb29","observation_id":"f18ff8ec-7831-40db-ae23-2ad982425d76","resolution":{"observed_at":"2026-08-02T08:03:50.205375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.299471Z","title":"Image-based table recognition: Data, model, and evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.299471Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:c238402db3a082ed0841c6fb2220e06d734fb5bae3732be6ac986fcc2795a185","observation_id":"b813af79-cfc4-4737-b96d-d3d64d555558","resolution":{"observed_at":"2026-08-02T08:03:50.299471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.507465Z","title":"Ng, Bo Pang, Piyush Sharma, and Radu Soricut","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.507465Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:ae1f17933e75d40196fc91340df5da9ed912c06436b11f65caabd358947210f7","observation_id":"376bbc96-f719-4cee-b2de-ff8d44b5118d","resolution":{"observed_at":"2026-08-02T08:03:50.507465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.596043Z","title":"M 6doc: A large-scale multi-format, multi-type, multi-layout, multi-language, multi-annotation category dataset for modern document layout analysis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.596043Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:21fd1531c29112bc8fff933e04121c4316cd81b8bb443e1043a1a66e43d036de","observation_id":"825c06cb-329a-4e70-9ba0-a2081c3f171b","resolution":{"observed_at":"2026-08-02T08:03:50.596043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.708674Z","title":"Global table extractor (GTE): A framework for joint table identification and cell structure recognition using visual context","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.708674Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:155563992fc1e7e978fb4f1fb69ee9b9acf8821e1119509db9646f00c7b9f187","observation_id":"1aab6c8f-758a-4247-ade1-69812b581af2","resolution":{"observed_at":"2026-08-02T08:03:50.708674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.802587Z","title":"Multimodal table understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.802587Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:069948f45cd1e36f5c2ae792a3a33835ba35eceb7be57268e29852ed3b71a2ea","observation_id":"b8e5a631-902c-4c0f-af2d-14a307a679d9","resolution":{"observed_at":"2026-08-02T08:03:50.802587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.895120Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.895120Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:206f597b67f841a80c5cf0688417310bd81a22449cd56b9833ca8163272f3b01","observation_id":"1527df3a-0ebc-442f-b656-d961e5de46be","resolution":{"observed_at":"2026-08-02T08:03:50.895120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:50.960982Z","title":"When counting meets HMER: Counting-aware network for handwritten mathematical expression recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:50.960982Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:711619dac4d8e18066059de98f51077879ad29b903e1e5cd0b0fda7c28e24a32","observation_id":"5b9898ed-61f2-4221-99d0-ee86a76909b5","resolution":{"observed_at":"2026-08-02T08:03:50.960982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.033891Z","title":"ICDAR 2019 CROHME + TFD: Competition on recognition of handwritten mathematical expressions and typeset formula detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.033891Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1b3dc50c187f4cc4b9bda885b0f329657afbcfa55cdc61e40bed0d2bee4d735c","observation_id":"bf39035f-48d3-476b-80da-032e02b660f5","resolution":{"observed_at":"2026-08-02T08:03:51.033891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.133598Z","title":"ChartAssistant: A universal chart multimodal language model via chart-to-table pre-training and multitask instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.133598Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:0aac0cad7b120069dd2a2036bc2a9aa5f45ea5a1a4760893c5d4db349d303d85","observation_id":"d05a59fd-9bda-4d44-9ebf-44b48fa6f847","resolution":{"observed_at":"2026-08-02T08:03:51.133598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.224748Z","title":"ChartMoE: Mixture of diversely aligned expert connector for chart understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.224748Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1ec0c7d7da5004404a7144cd7ef08d908fd52ac8cbc5024dbca06c62d0af389b","observation_id":"95ecdb53-6290-48e0-a399-1928b49f25e3","resolution":{"observed_at":"2026-08-02T08:03:51.224748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.319662Z","title":"UniChart: A universal vision- language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.319662Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:0c29007a2b246cca87a1ecf6058d90cf6027ae9adee464f3483c8a78d9ef7fbb","observation_id":"2b8db912-8e94-4247-8d53-73e470580c3a","resolution":{"observed_at":"2026-08-02T08:03:51.319662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.406773Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.406773Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:d82d2e2e1cd03513f7e7a2f0429af398169cfc985060aaedab648e9e45629b6a","observation_id":"1aba5c5b-c889-403f-853c-51f8201b4876","resolution":{"observed_at":"2026-08-02T08:03:51.406773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19492","last_updated":"2025-05-31T02:35:38Z","snapshot_observed_at":"2026-08-16T20:13:47.960421Z","submitted_at":"2025-05-31T02:35:38Z","title":"ChartGen: Scaling Chart Understanding Via Code-Guided Synthetic Chart Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19492","snapshot_observed_at":"2026-08-02T08:03:51.481676Z","title":"ChartGen: Scaling chart understanding via code-guided synthetic chart generation.arXiv preprint arXiv:2507.19492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.481676Z"},"links":{"cited_paper":"/paper/2507.19492","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:cf22e3028bde4267ba61ffa04f1146f0a440c306137ba33dc281b5feff7c85fe","observation_id":"c04f9d49-9beb-4f36-8a4e-ddabc1f80ae4","resolution":{"observed_at":"2026-08-02T08:03:51.481676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.554625Z","title":"ChartCoder: Advancing multimodal large language model for chart-to-code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.554625Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:b4344e93853dc54e38e3dfd7f6717d0c09cd34483a3cd687021c4609de61758c","observation_id":"e90c8e83-2546-4a8b-ae44-27b3bfcbd8fd","resolution":{"observed_at":"2026-08-02T08:03:51.554625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.614043Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.614043Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f1e0bcbd6ee4badd2d39dc6086411a933f947603df7c5cbb1ccec2cbb25eb32d","observation_id":"d0120624-4c68-494f-a9e3-bd04acb817b6","resolution":{"observed_at":"2026-08-02T08:03:51.614043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.729331Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.729331Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:b7b53596cdafd9f39bcdf9beae32e2391e30d3b4eeaadd895290ad991f92cbae","observation_id":"d786d410-5b4c-4ee3-8a3f-c83a1e020f72","resolution":{"observed_at":"2026-08-02T08:03:51.729331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-16T14:08:19.332089Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-02T08:03:51.775355Z","title":"mPLUG-DocOwl 1.5: Unified structure learning for OCR-free document understanding.arXiv preprint arXiv:2403.12895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.775355Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1740f5c881d9cf13e0fa781048e366e133409c5ccc2d4acd47771234d6f3b599","observation_id":"ccfee072-f5e6-40a4-be92-bdac0ad074c8","resolution":{"observed_at":"2026-08-02T08:03:51.775355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:51.838485Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.838485Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:e172b636b9d3854e1e8cbfe5929825abea44d824637ee7548cf3a3f0037db6af","observation_id":"1dfc6d72-6b3e-4dca-8a3b-a36548208d77","resolution":{"observed_at":"2026-08-02T08:03:51.838485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06706","last_updated":"2024-05-09T07:47:25Z","snapshot_observed_at":"2026-08-16T13:54:07.336578Z","submitted_at":"2024-05-09T07:47:25Z","title":"Exploring the Capabilities of Large Multimodal Models on Dense Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06706","snapshot_observed_at":"2026-08-02T08:03:51.928959Z","title":"Exploring the capabilities of large multimodal models on dense text.arXiv preprint arXiv:2405.06706, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.928959Z"},"links":{"cited_paper":"/paper/2405.06706","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:b78fcad8767adc0bc24e42dd121007c1962600f58c2bf7c57a86d43e1765ef04","observation_id":"ad93cb68-645a-43e9-9856-7dcc29fdd42b","resolution":{"observed_at":"2026-08-02T08:03:51.928959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16635","last_updated":"2024-04-25T14:23:24Z","snapshot_observed_at":"2026-08-16T13:57:52.292680Z","submitted_at":"2024-04-25T14:23:24Z","title":"TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16635","snapshot_observed_at":"2026-08-02T08:03:51.996346Z","title":"TinyChart: Efficient chart understanding with visual token merging and program-of-thoughts learning.arXiv preprint arXiv:2404.16635, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:51.996346Z"},"links":{"cited_paper":"/paper/2404.16635","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:a90dec698b2956c860a1dc4bb381f565289b9c1123bacb7b60b9ad8b496a453c","observation_id":"e5ead889-8c83-45b2-ba1a-b9fc1ea623bc","resolution":{"observed_at":"2026-08-02T08:03:51.996346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-02T08:03:52.063259Z","title":"LLaV A-NeXT- Interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.063259Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:211ad21570215da88bf53cf84d346442c65270370872480d5d176a23ade6cfb0","observation_id":"2629515c-ad97-4284-935c-6615ba2db859","resolution":{"observed_at":"2026-08-02T08:03:52.063259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.116163Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.116163Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:74d7f96d93edd07595c2d7d328bc38d53a08e484d822a82a7a1a4edf60f4a843","observation_id":"b783538e-ffee-45f4-8c6a-5b6ed2bab9a4","resolution":{"observed_at":"2026-08-02T08:03:52.116163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.157611Z","title":"ShareGPT4V: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.157611Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:6d7b9d95a97fb070c1536a1f3a58e546b7f5ae3b3b93f4b5250dc2e3e2a8c440","observation_id":"0e80cc05-cf67-4493-aff6-3ae0be19de1a","resolution":{"observed_at":"2026-08-02T08:03:52.157611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.202706Z","title":"ShareGPT-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.202706Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:245b72fbf3d2bd139461f896eae08da54a92625d36660359eaa4099023618cda","observation_id":"10aa3285-e0ba-471e-85df-bc8cff2fc6cd","resolution":{"observed_at":"2026-08-02T08:03:52.202706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.240070Z","title":"CogVLM: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.240070Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:7ffcf906a309d21a3e78406ddfb5886a1a2d1194167d69d057b422a454ab6783","observation_id":"12ccc19d-c764-4ea9-bd5d-335333b154c4","resolution":{"observed_at":"2026-08-02T08:03:52.240070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-02T08:03:52.279708Z","title":"ALLaV A: Harnessing gpt4v-synthesized data for lite vision-language models.arXiv preprint arXiv:2402.11684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.279708Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:246df66c312e36b7d7955f6918d06002922577b256c93875759768c130e971bd","observation_id":"d9ce6021-0736-4b19-8f31-9f19cda1160a","resolution":{"observed_at":"2026-08-02T08:03:52.279708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-02T08:03:52.315630Z","title":"To see is to believe: Prompting GPT-4V for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.315630Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:925e18b2a110041a2347bfdfae00b59aae2a580b26fadafb581dbff336ab3d21","observation_id":"011eca1f-ffd9-45a6-a8a8-4b041fdf3c3c","resolution":{"observed_at":"2026-08-02T08:03:52.315630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.360782Z","title":"Towards VQA models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.360782Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:4927b2bf33774fbf2c402e93f0e56bc1c6b6dbf70920aa5a71e34fbe2d1566de","observation_id":"b07ad7f5-0ad2-4844-a0ac-eabc81317d56","resolution":{"observed_at":"2026-08-02T08:03:52.360782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.398275Z","title":"OCR-VQA: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.398275Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:332f20dc83b8b91d324e32c99ef2710a995fa5e157cb2c1872f1be7a80a939aa","observation_id":"c7794020-2113-4573-a2f7-5da36894be3d","resolution":{"observed_at":"2026-08-02T08:03:52.398275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.438268Z","title":"The chemistry development kit (CDK): An open-source java library for chemo- and bioinformatics.Journal of Chemical Information and Computer Sciences, 43(2):493–500, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.438268Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:d5d1f33f3d7b5a7274d1e4061e75c2a27d69032ec55b960fd20dbbe9ae25d5ce","observation_id":"fa405e1f-bcb4-4be4-8eaf-0a87a4818e4a","resolution":{"observed_at":"2026-08-02T08:03:52.438268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.488522Z","title":"RDKit: Open-source cheminformatics.https://www.rdkit.org","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.488522Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:4180cb09563406e5fa544148f94a602c79bcd37efe19fb1ebcc6c56a7f391899","observation_id":"a8348539-660b-448b-b36e-146e5e35a7f4","resolution":{"observed_at":"2026-08-02T08:03:52.488522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.564578Z","title":"OpenChemLib: Open source java-based chemistry library","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.564578Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1885a2457e4721d698af23c8dabfbea9e363425b2e9130b85409511e30875617","observation_id":"e77223bc-d455-4ceb-9518-0d7daa587dac","resolution":{"observed_at":"2026-08-02T08:03:52.564578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.615993Z","title":"Indigo toolkit: Universal cheminformatics toolkit, utilities and database search tools","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.615993Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1ebc947e1525e56a4a92c51249947b9378c076a55006fa678c4e27dcd3dacf32","observation_id":"504ee0d7-0252-49c1-b1ac-3ead921725a9","resolution":{"observed_at":"2026-08-02T08:03:52.615993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.658535Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.658535Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:810fb5ca82a3ce2c0b369265c9b46531ced84b9ad9ffa152c4db6055071ed678","observation_id":"ffa46b08-3601-4ab3-b495-da1cfe49cc46","resolution":{"observed_at":"2026-08-02T08:03:52.658535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.714590Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.714590Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:07e374a39cf5a5905934435a82fb17b854832f7a0eaa6655fce6eb27566aa361","observation_id":"65e15ab1-4539-4a0e-9991-2369ff0e50a6","resolution":{"observed_at":"2026-08-02T08:03:52.714590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.769367Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.769367Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:01d57a6de35a9e627a7a4fa628b5a38c88088ced727ae1ae59c455322cbbd337","observation_id":"538063f1-6ed0-48fc-97d5-fe3c87e54db6","resolution":{"observed_at":"2026-08-02T08:03:52.769367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.867253Z","title":"Image over text: Transforming formula recognition evaluation with character detection matching, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.867253Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:eeb1351a6ba78ce6a56e78862935956986e0c479c3069460d064f69990f32706","observation_id":"afcb64bd-06fa-47ef-b649-dc9db64a48f0","resolution":{"observed_at":"2026-08-02T08:03:52.867253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:52.915959Z","title":"Deplot: One-shot visual language reasoning by plot-to-table translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.915959Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:e7ebb47e6ef9840d5756fac62b8a64a384f233ba7947b202aa0ab2c2636de1b0","observation_id":"e5514488-a1bd-4f85-9a9e-5c3499e4b0be","resolution":{"observed_at":"2026-08-02T08:03:52.915959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11268","last_updated":"2024-12-04T12:43:30Z","snapshot_observed_at":"2026-08-16T14:59:08.612638Z","submitted_at":"2023-09-20T12:51:13Z","title":"StructChart: On the Schema, Metric, and Augmentation for Visual Chart Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11268","snapshot_observed_at":"2026-08-02T08:03:52.986372Z","title":"Structchart: Perception, structuring, reasoning for visual chart understanding.arXiv preprint arXiv:2309.11268, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:52.986372Z"},"links":{"cited_paper":"/paper/2309.11268","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:45baed59ece4b81ade43167a5626d93b8e660e4622748f048a25e7cebec53baa","observation_id":"aea5c4e4-13fe-44be-be0c-0f38133861f2","resolution":{"observed_at":"2026-08-02T08:03:52.986372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.044747Z","title":"An elementary mathematical theory of classification and prediction","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.044747Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:d8b09640a392e24cc4103078b0e816cf99f861ec9156f48c048e5bae41288923","observation_id":"301fa0e3-bfc0-4f31-9167-9889fed8898c","resolution":{"observed_at":"2026-08-02T08:03:53.044747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.094199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.094199Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:fbe1abd1bd284260cd38bb8cbd988bd384d6a4a0f364b2a9fa3b293edea8b70d","observation_id":"add42f55-6ddf-46b0-b119-8f9e7b2a6de9","resolution":{"observed_at":"2026-08-02T08:03:53.094199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.147939Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.147939Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:03f88a977659d3f946a214019dee4a0f596ee963bfdb86c2ab4e0d367ae042de","observation_id":"f17370a9-cbfa-463d-b74c-2be39d203fe3","resolution":{"observed_at":"2026-08-02T08:03:53.147939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.217094Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.217094Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:9d8576aba924b5a42d49db56c821c41ceec343c3b8009e319b3e74a56f22e2b2","observation_id":"0a0a52d0-9145-441b-9711-0ed33ab1aee8","resolution":{"observed_at":"2026-08-02T08:03:53.217094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.340293Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.340293Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:8c7c95374c9f80193840ab5d04655d594b74c66301236e4ed438a3f85d8a6729","observation_id":"2e703484-e9f0-433f-b581-53e27c56c23d","resolution":{"observed_at":"2026-08-02T08:03:53.340293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.477906Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.477906Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:7ca4ee8b390ee517fe1fe9ac92d3ce21b623eaffa031913105a29ab36963cc87","observation_id":"1da8f40d-5770-485d-88d6-17fd127d5d6a","resolution":{"observed_at":"2026-08-02T08:03:53.477906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.510981Z","title":"olmocr: Unlocking trillions of tokens in pdfs with vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.510981Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:08875a0a44ab1dec812f7a049be6513a58425c8979acd33aee7559eabb358dea","observation_id":"812e564a-8f70-42b5-a3de-b032c5b18227","resolution":{"observed_at":"2026-08-02T08:03:53.510981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.587500Z","title":"Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.587500Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:663c6bf73a9f87a68bc5f3c4d4fcb2eed09b84b3c69021633c62f0d7d5e207c6","observation_id":"b3308e03-7e9d-41ad-bbfb-905b5ee58623","resolution":{"observed_at":"2026-08-02T08:03:53.587500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.626442Z","title":"Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.626442Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:d0d59ba0fc3706cf991c1090df86d0936bacd259c847913d4e1be40bbf881199","observation_id":"df06e98b-d709-4761-8b9b-ef716b2ecb43","resolution":{"observed_at":"2026-08-02T08:03:53.626442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.691843Z","title":"Marker: Convert pdf to markdown and json quickly with high accuracy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.691843Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:d531c6ba19752bf0c31587165275472dd61d8c6c269b71badd1bcde165807ee1","observation_id":"eb81fc1a-d8a1-47ca-b7d1-03ee674fac55","resolution":{"observed_at":"2026-08-02T08:03:53.691843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:53.774465Z","title":"Nanonets-ocr-s: An image-to-markdown ocr model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.774465Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:ccb5c036a94557e9391d41b8785fc8bed89d335dc60f8b9006ecaf31f9d54c69","observation_id":"4a0924b4-caa7-4e68-9436-7c5f3928a4e8","resolution":{"observed_at":"2026-08-02T08:03:53.774465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14251","last_updated":"2026-06-30T08:51:50Z","snapshot_observed_at":"2026-08-15T00:42:48.972830Z","submitted_at":"2026-01-20T18:58:32Z","title":"LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14251","snapshot_observed_at":"2026-08-02T08:03:53.874751Z","title":"Lightonocr: A 1b end-to-end multilingual vision- language model for state-of-the-art ocr.arXiv preprint arXiv:2601.14251, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.874751Z"},"links":{"cited_paper":"/paper/2601.14251","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1541704ba5417e6f22431b5225c7b08d5a456ce023833185d901b480254706e1","observation_id":"9895c7c5-255b-4b13-957b-e2bc3ea7dd8b","resolution":{"observed_at":"2026-08-02T08:03:53.874751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T08:03:53.973894Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:53.973894Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:74adb72978fda7bef6e4e330470c5b17182d5981afa6df780c793f814f265d55","observation_id":"03c04587-06d3-44a6-9cd0-2d1258f03519","resolution":{"observed_at":"2026-08-02T08:03:53.973894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.024861Z","title":"Chandra-ocr-2.https://huggingface.co/datalab-to/chandra-ocr-2, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.024861Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:ce7de2430958738f4d0c72201254897499b5e7eb9201d4368b80c12f9b1ecb61","observation_id":"abfa2d63-5a64-491d-93ac-7fbbab150dd2","resolution":{"observed_at":"2026-08-02T08:03:54.024861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.114739Z","title":"Glm-ocr technical report.arXiv preprint arXiv:2603.10910, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.114739Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:104d0130f4a037b2f6aadb75444c2e2b777d4e88372152b1058f93e02dbc1f7b","observation_id":"e7379dd1-d231-467a-a6f3-5daa7cab0f97","resolution":{"observed_at":"2026-08-02T08:03:54.114739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.265820Z","title":"Doclaynet: A large human- annotated dataset for document-layout segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.265820Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:c42e6ea9a49442d52e38cde172356ff3eddcd6a25137e2e382223e216f8d229e","observation_id":"c405b1b9-e12d-4204-89f4-c63944cc6ff0","resolution":{"observed_at":"2026-08-02T08:03:54.265820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.422999Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.422999Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:7157c5d82b59c636672d5d0229aaf4a7ee356387a147015d7a4decdbaf2d67a4","observation_id":"6e4feeae-7e26-4861-9e10-97fadf6ff61d","resolution":{"observed_at":"2026-08-02T08:03:54.422999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.503181Z","title":"Pp-doclayoutv2: A document layout detection model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.503181Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:deca5c1fd6a4b8fbe082a7e219970c50d68e9b8da2dcf4a6cd424f259c30c532","observation_id":"9fa07e07-e9c1-4678-a1a6-22b7b48559f7","resolution":{"observed_at":"2026-08-02T08:03:54.503181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.670630Z","title":"Pp-doclayoutv3: A document layout detection model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.670630Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:dd33173bdb32eafeecd309cd185c99852d50ed0034fd7d28cae9f4b421650535","observation_id":"b66f38f8-ac0d-4f71-b283-56463dea3af9","resolution":{"observed_at":"2026-08-02T08:03:54.670630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12628","last_updated":"2024-10-16T14:50:47Z","snapshot_observed_at":"2026-08-18T19:38:48.253429Z","submitted_at":"2024-10-16T14:50:47Z","title":"DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12628","snapshot_observed_at":"2026-08-02T08:03:54.797396Z","title":"Doclayout-yolo: Enhancing document layout analysis through diverse synthetic data and global-to-local adaptive perception.arXiv preprint arXiv:2410.12628, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.797396Z"},"links":{"cited_paper":"/paper/2410.12628","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:0fd2ba0583eeaca1157e855020992d46b93b79d0c41b5dae6803591c0a2c3d3d","observation_id":"ad9fa08b-1784-44c7-b3a7-9582a952a4db","resolution":{"observed_at":"2026-08-02T08:03:54.797396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:54.974045Z","title":"Global table extractor (gte): A framework for joint table identification and cell structure recognition using visual context","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:54.974045Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f9a3741514541df319ac23ed9989c6c8d5b0b815159d5943d6becff4fc8b4f1d","observation_id":"20e2097e-e6e7-4e70-9273-3ccea8a21e0c","resolution":{"observed_at":"2026-08-02T08:03:54.974045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15254","last_updated":"2024-09-05T15:42:25Z","snapshot_observed_at":"2026-08-16T13:58:26.623634Z","submitted_at":"2024-04-23T17:39:27Z","title":"UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15254","snapshot_observed_at":"2026-08-02T08:03:55.056173Z","title":"Unimernet: A universal network for real-world mathematical expression recognition.arXiv preprint arXiv:2404.15254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.056173Z"},"links":{"cited_paper":"/paper/2404.15254","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:2a9bc606c584982958c10a390ba3bbd91a2cb33d89ebf6537a18146fc0cba54f","observation_id":"163f3cae-0670-404b-b9ee-7033befa98be","resolution":{"observed_at":"2026-08-02T08:03:55.056173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.087076Z","title":"Chart-to-text: A large-scale benchmark for chart summarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.087076Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f0907f3f99bc57787f325beca4d5aa310183355217dff4f533bc76653bcc2449","observation_id":"308bca7c-2e09-4f22-ae47-1c2134f8e6dd","resolution":{"observed_at":"2026-08-02T08:03:55.087076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.153880Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.153880Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:66143705d03c1e58e42fb686eae01d9d84aa642874760ad3b80688bf9bc5b022","observation_id":"76d65114-d923-4764-867a-d32fe39363fb","resolution":{"observed_at":"2026-08-02T08:03:55.153880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.225928Z","title":"Onechart: Purify the chart structural extraction via one auxiliary token","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.225928Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:7c140c2c48d00efd3c53416754f351d5af7608e1b0486bdf9f72073553bca36a","observation_id":"79a7655e-969c-4e7b-9e05-157d80003703","resolution":{"observed_at":"2026-08-02T08:03:55.225928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.291152Z","title":"Ocrverse: Towards holistic ocr.https://github.com/DocTron-hub/OCRVerse, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.291152Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:1f95513e4db09a23b0e46cde34f067930d2f78f8930dd6f38d977e0f537011df","observation_id":"961ba6fd-e48f-4865-a3a7-01eaab408e4e","resolution":{"observed_at":"2026-08-02T08:03:55.291152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.396124Z","title":"Img2mol–accurate smiles recognition from molecular graphical depictions.Chemical Science, 12(42):14174–14181, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.396124Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:3be9395c673ce20127cf2924bd8a94980ebe26332b2d7b4168def553cde63d36","observation_id":"21b82355-d4d5-46e8-b12f-915614d3fe04","resolution":{"observed_at":"2026-08-02T08:03:55.396124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.461116Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.461116Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:f60a1350a18a29787cb7fa6c3fade8dfa234b4b70f0895a63bb7583d740ac2f6","observation_id":"284851e7-d777-4168-ae4b-f8f8f96921dd","resolution":{"observed_at":"2026-08-02T08:03:55.461116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-02T08:03:55.589854Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.589854Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:9b72b86e39a6316309db971215bde6bb04c2cf3af1c4ffa93d26af76a02146e6","observation_id":"fcd39d97-56de-4b84-b259-d4989bc8cabf","resolution":{"observed_at":"2026-08-02T08:03:55.589854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.750451Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.750451Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:4f2a18ff467709170d3c8b859a15e4c621918c7f79432ec604cf916d684e0489","observation_id":"4a748d03-fce0-4ba1-bb8a-ed7494564f5f","resolution":{"observed_at":"2026-08-02T08:03:55.750451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.792033Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.792033Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:c0a6efd91e6b9689c6701bbac886c24e5e042d063b3c8de22d5e7711c6b643f3","observation_id":"bf15fbdf-1b43-4042-9b5e-aa53b88f84ff","resolution":{"observed_at":"2026-08-02T08:03:55.792033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.846473Z","title":"Are we on the right way for evaluating large vision-language models?Advances in Neural Information Processing Systems, 37:27056–27087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.846473Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:a0b0f90b40cd50328e082b8e300d3f1c0642c4ffad674c2deab7795c319e93ae","observation_id":"30c35535-f1e0-49c1-b563-f1478bd9207e","resolution":{"observed_at":"2026-08-02T08:03:55.846473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:55.888685Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:55.888685Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:96b18103e66f707404e569c7cf361c8e61843617352cf93b311247df0c2be660","observation_id":"16c5572d-0007-443a-a937-8c1d752ff0a8","resolution":{"observed_at":"2026-08-02T08:03:55.888685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.031215Z","title":"Hunyuanocr technical report.arXiv preprint arXiv:2511.19575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.031215Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:6c2758855537aa98daca27fa64c199903195a5bf14862922332222d3b6aa5209","observation_id":"00befa02-6d95-4fa4-818b-b9a9fdfebe07","resolution":{"observed_at":"2026-08-02T08:03:56.031215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.231800Z","title":"Qwen3-vl: Sharper vision, deeper thought, broader action","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.231800Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:e9ddc1a900bbae7c30fcecd130494815e49f0447c9cbb8eab163de3b23d34668","observation_id":"6d021254-203e-4142-af47-cf24c4961da6","resolution":{"observed_at":"2026-08-02T08:03:56.231800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.318147Z","title":"inf-retriever-v1 (revision 5f469d7), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.318147Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:3b93aa9d5b76339e36a4be04fe55b0582c41e5921684f563e6c1dac4833e0a8e","observation_id":"b98022eb-d8c5-43bc-9746-cb261c3e42ef","resolution":{"observed_at":"2026-08-02T08:03:56.318147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.442956Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.442956Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:4ccc524205fe6fdff3fa6aa67547c558572dbe43c991893fb349e814a5d23c90","observation_id":"2d5e9571-435d-4669-9597-e12c0a1dd8fa","resolution":{"observed_at":"2026-08-02T08:03:56.442956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.568020Z","title":"ChartMimic: Evaluating LMM’s cross- modal reasoning capability via chart-to-code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.568020Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:b83390ced098ef4e289dacbc6d90acbc38b7d083c7f04d96f0a9936f73caef68","observation_id":"5520b9fb-42f0-4e85-8771-762335b76591","resolution":{"observed_at":"2026-08-02T08:03:56.568020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.750971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.750971Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:58d9c69b09fed7a9be6956d1031029e4f709b8d4b5b84515b44697c891407153","observation_id":"e97f7eec-a4e5-484a-9528-c676549e0665","resolution":{"observed_at":"2026-08-02T08:03:56.750971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:56.909472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:56.909472Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:bee933b5189c8bf353b599e7f6892da5559a9f9a4811b4df4aadc2dd1c77a3b9","observation_id":"7b83ada6-fb2e-4dd4-a501-54c50a013c45","resolution":{"observed_at":"2026-08-02T08:03:56.909472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:57.144603Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:57.144603Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:b0bdda814d2ec6e381b466e966faf8e99250642e524e2629784079a54cf0bcfa","observation_id":"13d24dd7-d81a-4a0e-8faf-f39433fac7d2","resolution":{"observed_at":"2026-08-02T08:03:57.144603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:57.259355Z","title":"- The output text must be exactly the original text from the image, with no translation or rewriting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:57.259355Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:900b1cc38abad4bd0b39876edf3ccf6efb5753c0464b2a69d18ce57413d16562","observation_id":"588bd196-04ca-4abf-9b10-b290730caa91","resolution":{"observed_at":"2026-08-02T08:03:57.259355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:03:57.361625Z","title":"- Convert the recognized text into Markdown format","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-02T08:03:57.361625Z"},"links":{"citing_paper":"/paper/2607.07836"},"observation_digest":"sha256:ade7df74726182e380739f021e3f6f51db70a2fda82347ab96decc41c9a40a38","observation_id":"59fcb415-fd9e-4728-b438-66eb1465f279","resolution":{"observed_at":"2026-08-02T08:03:57.361625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.07836","last_updated":"2026-07-15T04:21:34Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T09:59:19.905072Z","submitted_at":"2026-07-08T18:17:21Z","title":"Infinity-Parser2 Technical Report"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 0 inbound Pith citation observations for arXiv:2607.07836."}