{"as_of":"2026-08-07T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d033fed46a17d0f25c38d372447afa0b8e1e1895fe48ec947b8299babe0b9156","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T01:46:00.580035Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:02:44.498255Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-08-04T07:02:44.498255Z","title":"Omniparser v2: Structured-points-of-thought for unified visual text parsing and its generality to multimodal large language models.arXiv preprint arXiv:2502.16161,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:44.498255Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:d150802c66e472c31c201572076fcca3966bf7a6db178362e116afd066054852","observation_id":"857f6a40-f154-4e3a-9f17-8ddba77c1603","resolution":{"observed_at":"2026-08-04T07:02:44.498255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-08-04T00:30:25.554263Z","title":"15 Xinbin Yuan, Jian Zhang, Kaixin Li, Zhuoxuan Cai, Lujian Yao, Jie Chen, Enguang Wang, Qibin Hou, Jinwei Chen, Peng-Tao Jiang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-06T18:38:19.524231Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.554263Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:231b37a67e4d4182fda019d533a12e29b86cc0ff532f3880b7d05c2f3a075732","observation_id":"1082df2f-537e-4cea-aac1-077ec8bce7d1","resolution":{"observed_at":"2026-08-04T00:30:25.554263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2512.12634","last_updated":"2026-05-31T23:48:10Z","snapshot_observed_at":"2026-08-03T16:38:30.744758Z","submitted_at":"2025-12-14T10:41:39Z","title":"MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T22:59:16.413568Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2512.12634"},"observation_digest":"sha256:c8384f9fd3154a38337d3e9107ec64bc60a212c3b729afdfb9a0bc8d6daf1697","observation_id":"f966fed9-3b47-4c38-b93f-9d4146b8e943","resolution":{"observed_at":"2026-05-16T23:01:20.564324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-08-03T16:38:37.451063Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.12634","last_updated":"2026-05-31T23:48:10Z","snapshot_observed_at":"2026-08-03T16:38:30.744758Z","submitted_at":"2025-12-14T10:41:39Z","title":"MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:38:37.451063Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2512.12634"},"observation_digest":"sha256:faa042e7625aebe6ca4e9d6ae9a14cdce7b93161941adcf0c937cad5d9ec7013","observation_id":"ff975bca-8771-4def-a02b-a6391413d32d","resolution":{"observed_at":"2026-08-03T16:38:37.451063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2604.02880","last_updated":"2026-04-17T07:24:14Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T08:44:45Z","title":"InstructTable: Improving Table Structure Recognition Through Instructions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T20:53:57.029294Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2604.02880"},"observation_digest":"sha256:3a74447c705251edf588f83a9e9722b3c4580040c32e55e0c4772b0196ead115","observation_id":"aa7e96e1-cd41-4ed5-856a-ee7c982473f9","resolution":{"observed_at":"2026-05-13T20:58:16.054688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:34.401698Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2604.08516"},"observation_digest":"sha256:da3af47aeb39aaba475236de0f4d86dc38a0e97fba0323edbdfe1b77a6bec5b0","observation_id":"35b5a14a-efa8-437f-b74a-ebd5a49636e3","resolution":{"observed_at":"2026-05-11T05:40:58.655472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2605.02630","last_updated":"2026-05-04T14:18:46Z","snapshot_observed_at":"2026-08-04T23:36:29.909927Z","submitted_at":"2026-05-04T14:18:46Z","title":"AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T18:37:48.993080Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2605.02630"},"observation_digest":"sha256:83cf382156912f7604c59f12dd2c2d36414521ca143acdf18d6d1480fbef3bc2","observation_id":"31c2d01d-f65f-4b92-bab1-50c8e0dbed3b","resolution":{"observed_at":"2026-05-09T06:20:38.679110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2605.14311","last_updated":"2026-05-15T06:09:21Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T03:23:44Z","title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-15T01:58:19.295247Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2605.14311"},"observation_digest":"sha256:dc5118fd29defd1879cbf06b238b022ba79719ac232f293d9f08fd35952a00f0","observation_id":"8dfae63a-20a8-434a-a161-58a7e4fbb871","resolution":{"observed_at":"2026-05-15T01:58:28.772144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2605.14311","last_updated":"2026-05-15T06:09:21Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T03:23:44Z","title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","version":2},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-19T16:45:16.963802Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2605.14311"},"observation_digest":"sha256:6c88d23df82b31dbd10ca5aa596721066c3392997d256a01b5b4240af4817af9","observation_id":"c4e55fcd-f82a-4e91-b124-51c1dfa09309","resolution":{"observed_at":"2026-05-19T16:47:40.420945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.16161","doi":"10.48550/arxiv.2502.16161","metadata_source":"pith","pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","venue":"cs.CV","work_id":"c7b99378-fde0-4aef-99ae-f4462c92d74c","year":2025},"citing_paper":{"arxiv_id":"2606.17871","last_updated":"2026-06-16T12:42:09Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T12:42:09Z","title":"StepGuard: Guarding Web Navigation via Single-Step Calibration","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T01:34:10.325378Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2606.17871"},"observation_digest":"sha256:d0947b4e97a41cc56269d0408bc52c2ea666975fce5ef8999d97580efd1cfd47","observation_id":"286a4907-071d-463b-a99f-d7ca1b40faae","resolution":{"observed_at":"2026-06-27T01:40:21.154131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.16161/citation-record","integrity":"/paper/2502.16161/integrity","json":"/paper/2502.16161/citation-record.json","paper":"/paper/2502.16161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Platypus: A generalized specialist model for reading text in various forms","venue":null,"work_id":"fce9c0c0-a48b-433a-97ec-82a35f04d19b","year":2024},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:7cade7f8cabec75fbd80b12cc53c885f63074c9bd772ddfbd0b989356f586e40","observation_id":"13e65ec5-eb4e-4459-9780-9c13d1e65a6a","resolution":{"observed_at":"2026-05-23T01:47:22.608542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":"82379e14-d3b4-4e1d-839f-88ffb3cbc5c6","year":2017},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:477fa3ce87b38e09b6fabc9fd4ffd778779681c242177bfcd31a5dc5a0df2fae","observation_id":"3c266900-febe-4838-8167-411660fe3c23","resolution":{"observed_at":"2026-05-23T01:47:22.606082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"b6ba7dc4-75d1-4f52-94a6-42ac3c744601","year":2013},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:5c000a3a5429442ac7ed42fd8a77fc7a2a0fbc75b0141de87b84169b71625649","observation_id":"93565460-fbf8-4697-97ac-7e5a24a20fb8","resolution":{"observed_at":"2026-05-23T01:47:22.573637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end-to-end unified scene text detection and layout analysis","venue":null,"work_id":"76e1ac16-08d9-49cf-b305-b20e879f6cbc","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:5eb6a0773586f4bdfa4bac95793c139e07dc65557b2289bff590ef0f1658e4b4","observation_id":"57ebaf9e-277f-4023-87e1-633d5d82aff7","resolution":{"observed_at":"2026-05-23T01:47:22.554970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary- shaped scene text","venue":null,"work_id":"c475962b-67b8-40b3-a9cd-c80813e9bb73","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:a2f1dc57aa2b90fdb210d163520edbde17bf557f27e1682de7fc3ad68423d33b","observation_id":"210b4449-ce46-401d-85b4-767576d4ae98","resolution":{"observed_at":"2026-05-23T01:47:22.591873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abcnet v2: Adaptive bezier-curve network for real-time end-to-end text spotting","venue":null,"work_id":"c1e3cb99-87d6-4609-9ec6-b55a8af30d98","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:d19474aa1606bc6be44cf5214a1c4a71106c9ffe98b8c257dd4b53e3514aa809","observation_id":"751405ab-7c29-4c9e-8b38-2ded99a6337d","resolution":{"observed_at":"2026-05-23T01:47:22.561641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open images v5 text annotation and yet another mask text spotter","venue":null,"work_id":"e6c74b0d-f1d7-4268-9419-e19d85dcffdc","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:4dd52841fd39bcab7ac4582364aa6267f74e8e5782c9e18e56b14a08efb309a3","observation_id":"b19aa20e-9a73-4309-b68d-b1054d2b7f06","resolution":{"observed_at":"2026-05-23T01:47:22.589552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doclaynet: A large human-annotated dataset for document-layout segmentation","venue":null,"work_id":"e426db69-d513-4d81-a1ca-7e52709f0e12","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:16582a37bf61f68aabf57d34efc06bd2c4916839deb958e4219753627c9e521c","observation_id":"0be2cda8-8f54-49a1-a482-df1179e01030","resolution":{"observed_at":"2026-05-23T01:47:22.619159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2017 robust reading chal- lenge on multi-lingual scene text detection and script identification- rrc-mlt","venue":null,"work_id":"472b4397-b1f9-4d23-8ed6-51ddff06dd2f","year":2017},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:4d56034303959d20cd4793bb5b51abaea26bee5f0d68516fe3ffe221703484d7","observation_id":"f4e6febe-c698-42c8-9c04-6c94d882ab9e","resolution":{"observed_at":"2026-05-23T01:47:22.564412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coco- text: Dataset and benchmark for text detection and recognition in natural images","venue":null,"work_id":"6aeb1793-e520-462a-b6b9-e37bda0a147e","year":2016},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:4e1490aa45eb4e06b9740ef419370d8a11655d6f042b5d5132d9dd8201868b77","observation_id":"e6fccc06-10fc-477d-a5e2-7c92fd14288c","resolution":{"observed_at":"2026-05-23T01:47:22.578499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":"8347bc5c-d27e-4c48-90f7-23a7e25eb5b2","year":2023},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:99e71e0f452c5612e71382fe723fa7e8be964ea7b76f06ffb9c1671c3ff6c183","observation_id":"f6477e2c-4157-4a71-863e-560eacbf0db6","resolution":{"observed_at":"2026-05-23T01:47:22.583106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"7a135489-3e8d-4b42-8da4-15469557a96c","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:2c2e7ab827b2bfeacc1ae83d268ab805487b97a77c4e0effb7454c590e180280","observation_id":"18a860fa-498a-47d2-8ee4-2b242c3a20a7","resolution":{"observed_at":"2026-05-23T01:47:22.576089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Publaynet: largest dataset ever for document layout analysis","venue":null,"work_id":"e41124cf-c4ee-4ada-807b-ae97ea431627","year":2019},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:36e23bca0fe08552b9fc32937cdbd2928aeff01debef62228a7bfa9fab07a333","observation_id":"9038b828-7e2e-47ae-b98c-4c98f97df9b7","resolution":{"observed_at":"2026-05-23T01:47:22.598747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"6d301cd5-1d74-4e27-bd90-ae29fa2ecc07","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:4645de082c1ba0386064154d2bd90a4dc14b4f4f7d63cdcaf24c1b5c6b2fec27","observation_id":"b8f1e4f2-29e6-4bc8-830f-c8b649fec6f7","resolution":{"observed_at":"2026-05-23T01:47:22.566818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional text image generation with diffusion models","venue":null,"work_id":"c8def55e-3c14-455f-add8-bc94635a0e95","year":2023},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:e98d0236daf908e1192c28ff0e5edc6afad8a94dc6aa64b3baa14df1c3137f35","observation_id":"0c303b5f-53ce-487f-b7f4-737d6dd13490","resolution":{"observed_at":"2026-05-23T01:47:22.596170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards unified scene text spotting based on sequence generation","venue":null,"work_id":"ed2332cd-d7b7-47b4-8ded-ef890c9d75f8","year":2023},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:be2bd761c953b90a4bc028272899317ad0f359da6bf48c007d865ddfb8de9492","observation_id":"b79dadf4-a3d8-439a-97da-672bae7a6d53","resolution":{"observed_at":"2026-05-23T01:47:22.614070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges in end-to-end neural scientific table recognition","venue":null,"work_id":"dd7dbd4f-ce43-4d07-b5c9-e51ffcaa5eeb","year":2019},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:d2f1e0f39bcf52f6cf2e495bf0308d6fa93d6807ccf9e025360c84921e0d046e","observation_id":"a323e862-da0d-448e-91a0-349e9e29b5f0","resolution":{"observed_at":"2026-05-23T01:47:22.593840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tablebank: Table benchmark for image-based table detection and recognition","venue":null,"work_id":"5d99d34b-2c0a-4c86-8b9b-efb6cec302c0","year":2020},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:4cbd08a531d6360f70c983cd821b376c268f8e4fd6635b62b961a08342f82bed","observation_id":"4b29dbe5-aecb-43c7-a22b-35ba7d679a91","resolution":{"observed_at":"2026-05-23T01:47:22.557251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An open approach towards the benchmarking of table structure recognition systems","venue":null,"work_id":"699dd060-d71d-415d-824f-4f0ab5f328c4","year":2010},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:1c63cffe8af7eac7d7b45624513c127ef32fe3455c68aff61273d71609b4974e","observation_id":"5d0f5c36-bd14-40ce-be5d-8218542424be","resolution":{"observed_at":"2026-05-23T01:47:22.559559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2019 competition on table detection and recognition (ctdar)","venue":null,"work_id":"a7cd46ba-22eb-4b08-b0cc-0933ffed1a03","year":2019},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:455a42d28bbaf13b1612abfefc210f2add68a4d8bc74e5ce94e5f9fd0185dc46","observation_id":"b12533ee-63d3-49ce-9193-e7f8bbdc9081","resolution":{"observed_at":"2026-05-23T01:47:22.587593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parsing table structures in the wild","venue":null,"work_id":"6660f238-995b-418a-8234-84bc8175c855","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:1c4774a2f4d4bb998c5567b87fff3bbc420c4b3ba8d5d4a3c61027de949a443f","observation_id":"e9776811-ce66-4bc5-aa16-9c4055d19ad2","resolution":{"observed_at":"2026-05-23T01:47:22.616495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual understanding of complex table structures from document images","venue":null,"work_id":"51eb5598-e826-4dbe-9b82-ab90aca9bb48","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:a1ee0987f6242bc1fc2c49d9b97ebd7d72e4a2717c929100e04c0ea406119d38","observation_id":"d0b25758-1fa5-481c-8a05-2d66df6560ef","resolution":{"observed_at":"2026-05-23T01:47:22.601327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar 2013 table competition","venue":null,"work_id":"909940a1-dc4b-41b0-b5bb-546d216e498d","year":2013},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:7de0c9061534add88e338105f2859673f28812d6eebd9ee669583f1a8daebe31","observation_id":"e3d7c24c-885e-418b-9a3d-522d468b3c32","resolution":{"observed_at":"2026-05-23T01:47:22.580948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Com- plicated table structure recognition","venue":null,"work_id":"c1813d6f-eccf-4134-b8b4-0d15138232e7","year":2019},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:bebe0be67df05f2e1194fd8876c9346db63cd1e35f22f9452c385a4ffba7bf22","observation_id":"e2cbbbd0-0ab7-4a5c-8f6a-12f1370ce05e","resolution":{"observed_at":"2026-05-23T01:47:22.603614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pubtables-1m: Towards comprehensive table extraction from unstructured documents","venue":null,"work_id":"3090dcc7-ba88-45ab-9225-14f15f009c6b","year":2022},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:817e448a3f8ad835f4fa61551eb34f9ded19dd800328a0f16fdd80317370a881","observation_id":"d3b52e2a-10dd-4821-8851-b8108b94d53b","resolution":{"observed_at":"2026-05-23T01:47:22.611610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-based table recognition: data, model, and evaluation","venue":null,"work_id":"f183ef4b-7aed-471f-b13e-ea3050ebf5d5","year":2020},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:6f6aff9e619382445decb0dba37aa79deaf19abe5bd0627f5bba1a1db45fddb9","observation_id":"9b65f55a-32a5-4e6b-8fcc-f75339006c80","resolution":{"observed_at":"2026-05-23T01:47:22.552622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Global table extractor (gte): A framework for joint table identifica- tion and cell structure recognition using visual context","venue":null,"work_id":"0bb52a08-240d-4f00-b925-5b1eac06a2d3","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:71f011556d4769d86c01dcf0a00fb1fe25bd6cd3fe7aa487780fc73de84ce774","observation_id":"bb386544-2e6a-4f95-9fe7-77924694580c","resolution":{"observed_at":"2026-05-23T01:47:22.571447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pingan- vcgroup’s solution for icdar 2021 competition on scientific literature parsing task b: table recognition to html","venue":null,"work_id":"d06f1f10-acf3-445c-9c63-bcf4edf8ea7c","year":2021},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:e516003edf0f510a6938f44633ff7b51b3e14550c2b1c51de8e331c09963ffc3","observation_id":"85653bd0-aa54-4f63-8088-807f7dcc162e","resolution":{"observed_at":"2026-05-23T01:47:22.585188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving table structure recognition with visual- alignment sequential coordinate modeling","venue":null,"work_id":"475b5633-53a6-4008-81e9-6481bc9d7ba6","year":2023},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:d905afc8da9e114c673c071c3ae25ea962333a2b80deb00c82b8c1dcf2b56240","observation_id":"a10ba39d-4254-4358-a6e8-d031c44d6f7a","resolution":{"observed_at":"2026-05-23T01:47:22.569158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":"e5b56a70-ba29-4975-bbc0-80a2bcf9790c","year":2025},"citing_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T01:46:00.580035Z"},"links":{"citing_paper":"/paper/2502.16161"},"observation_digest":"sha256:3e8b5b672d3ef37d0c14d6f3233b07d1ea404a76299f093f6a7eb08d1b03d30f","observation_id":"3557634e-ba91-40fd-a72d-6117be7c09e6","resolution":{"observed_at":"2026-05-23T01:47:22.623354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 10 inbound Pith citation observations for arXiv:2502.16161."}