{"as_of":"2026-08-20T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00c28c1572d71142532668b32e6d37fc25a145fb8f5707bd1ca72ec8074113dd","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:22:13.476296Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27902/citation-record","integrity":"/paper/2607.27902/integrity","json":"/paper/2607.27902/citation-record.json","paper":"/paper/2607.27902"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:08.635594Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:08.635594Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:9530bc2ff32de558fbd8ed5334ff4dd6cc98696aaa1b2f19f3e3dd773cb7cb05","observation_id":"0816c7ec-d01c-49ea-8cfb-ddf9beee6657","resolution":{"observed_at":"2026-08-04T03:22:08.635594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:08.713601Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:08.713601Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f753bca1299bffb013982b993439553355ef78eb72d09f7225c52d14e2d04fa2","observation_id":"5a77cc0b-c772-4a29-a7f9-26dd1843bb3a","resolution":{"observed_at":"2026-08-04T03:22:08.713601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:08.842461Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:08.842461Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f271f252dbcd779b72f86b93dfceb94a046387bedfdc24bd272d9ccca6d3e0e5","observation_id":"a229d704-96b6-43c2-b753-376b5dcafc70","resolution":{"observed_at":"2026-08-04T03:22:08.842461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:09.059622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.059622Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f4114d978fd888f9a187143d92e53a825205118d80be7ff4faa2c538779c7ca6","observation_id":"fa1f0bf0-74c9-4c1f-8655-67520fdcdc7f","resolution":{"observed_at":"2026-08-04T03:22:09.059622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:09.280058Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.280058Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:717156e7a657e29cde7f8bde6838069be1bbfa61d7139b6101b918e18cc40823","observation_id":"8369cad0-077a-4848-95b2-d3782c02baa2","resolution":{"observed_at":"2026-08-04T03:22:09.280058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21957","last_updated":"2026-04-03T06:49:11Z","snapshot_observed_at":"2026-08-13T13:13:25.351259Z","submitted_at":"2026-01-29T16:35:04Z","title":"PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21957","snapshot_observed_at":"2026-08-04T03:22:09.389422Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.389422Z"},"links":{"cited_paper":"/paper/2601.21957","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:d500a5ec43de2721749200821d93290abffa42639fa63733c8c3f74f0a1710d2","observation_id":"23a99315-b9f8-4244-a5be-51064416e3fb","resolution":{"observed_at":"2026-08-04T03:22:09.389422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:09.543692Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.543692Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:38a3a30b8a067491734d782117b59a587230e21751f19dce446afa7f2c584726","observation_id":"9cb41eaa-c793-44dd-8c3d-7902e66fb30b","resolution":{"observed_at":"2026-08-04T03:22:09.543692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13861","last_updated":"2024-10-21T15:42:46Z","snapshot_observed_at":"2026-08-16T23:13:56.317647Z","submitted_at":"2024-10-17T17:59:57Z","title":"PUMA: Empowering Unified MLLM with Multi-granular Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13861","snapshot_observed_at":"2026-08-04T03:22:09.894169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.894169Z"},"links":{"cited_paper":"/paper/2410.13861","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:d508887636f88aea815453d8212fcbbf5718bff1e7e070e2c4861dc886d0ba36","observation_id":"747e83ae-07e7-4aac-89f3-25c83b3a7ebd","resolution":{"observed_at":"2026-08-04T03:22:09.894169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.046145Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.046145Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:c26a528fdabf03151ad19c307983856fa096612c1dc51e0a0b1908114cc2d58e","observation_id":"899b0b9e-048b-4f18-988a-473f7c7cb276","resolution":{"observed_at":"2026-08-04T03:22:10.046145Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.143840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.143840Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f45edaaddd8fbf013a1aaf01064c7a51a862e0faccb80cdd47b27b402fe1836a","observation_id":"7bff85b2-51dd-4791-8893-504317f36c19","resolution":{"observed_at":"2026-08-04T03:22:10.143840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.220936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.220936Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:129a361ef937542fd07e454a994815fae22528a6a7c7e36843e793b1f38e18de","observation_id":"956929f4-1172-4943-991c-7eb6bc675c53","resolution":{"observed_at":"2026-08-04T03:22:10.220936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.373626Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.373626Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:3b45832f782581d50931603f6fa80b3f1294be8e44ff50386cec80afd5c1c173","observation_id":"38f03fc6-7b3b-4964-b095-48ca2859c123","resolution":{"observed_at":"2026-08-04T03:22:10.373626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.538597Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.538597Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:5049add91eb8ddfc3d51a24d8dda6dde6f658a8c7e79015cff2686ba573bda03","observation_id":"a394859d-8836-4532-ae4a-967c79f609d2","resolution":{"observed_at":"2026-08-04T03:22:10.538597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.699451Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.699451Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:cdc8f1182cbe59d57b8c9c503f98d2211770e6d5b0caf7c759e909f276625132","observation_id":"065f4784-ec0d-436c-bf5e-6df6887fa878","resolution":{"observed_at":"2026-08-04T03:22:10.699451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:10.864868Z","title":"2026.TRL: Transformers Reinforcement Learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:10.864868Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:33f8ac149f07adb62062d2bf48528984eb4efa8346c1205d556a22d9b1e15fbb","observation_id":"94567e98-9d72-4349-9d88-c28abc007cd5","resolution":{"observed_at":"2026-08-04T03:22:10.864868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.027627Z","title":"Ghosh, Andrew D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.027627Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:16265b32a5cf5b2bee2f3c93962d1f01bf4e24254b467fd933346cd0dc973502","observation_id":"2c53b955-0b38-44ef-8b5e-3de8cc67ea0c","resolution":{"observed_at":"2026-08-04T03:22:11.027627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.134453Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.134453Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:484bd039cc826b1d4f937927cea9e077aec8dfd75205c5b45df22d1176ae910a","observation_id":"3a5a217e-6803-48ea-a9ba-d8e7c45f285a","resolution":{"observed_at":"2026-08-04T03:22:11.134453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.250370Z","title":"Jaakkola","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.250370Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:0a03f4706e86959f544e81fe29e0e4ce58a815e318de668c431a127a462aaf28","observation_id":"933c0ff1-b8ef-4674-bd5b-d633f85e6fd8","resolution":{"observed_at":"2026-08-04T03:22:11.250370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.501927Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.501927Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:4c89c4f154ba7f264830a89e36e74b06810dd4ca376591d345567cc2525f5d60","observation_id":"79aa3288-4732-4557-99ca-3925bac3ef6e","resolution":{"observed_at":"2026-08-04T03:22:11.501927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.616695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.616695Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:ea36cdb752488241c274d67b719ccb5656e9cb6936b38fca73e2f31a022ce747","observation_id":"79f9e756-1d28-43cb-b9ae-7eef0ecc091f","resolution":{"observed_at":"2026-08-04T03:22:11.616695Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.728750Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.728750Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:fb112fa4591a3b7c07b77aed0196cc62f6cd2fd870756188ef4f569150a97d48","observation_id":"a1448a85-1c6b-485e-8eef-cb09c02c8327","resolution":{"observed_at":"2026-08-04T03:22:11.728750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.841840Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.841840Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f8e55a0965b4fff3a8e1554f34e97c91d9ce2b2f9c029eacf39ddbca43112d44","observation_id":"5a995e49-2306-42d1-a581-f1b29c332eec","resolution":{"observed_at":"2026-08-04T03:22:11.841840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:11.954241Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:11.954241Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:dc500b72b201e0efd356514d5b468213758eb9b0737ca91ec3c4f702b12dcf68","observation_id":"d337fb5e-2d69-46fa-8ac6-f7ebe73e68a2","resolution":{"observed_at":"2026-08-04T03:22:11.954241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.068440Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.068440Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:047e61a9079d3c748e7f325e8f0a464a800d2f247254dfd0ae793a21f4b8a2de","observation_id":"21380f7e-bc39-4b87-8978-e52aca747018","resolution":{"observed_at":"2026-08-04T03:22:12.068440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.168048Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.168048Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:bb728bd5e227b79d6e87b879f2a4b3260ce684a5f86dd32615a47272d7c38e01","observation_id":"bae44e8e-43a2-4654-aa1a-deba1ab87aec","resolution":{"observed_at":"2026-08-04T03:22:12.168048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.263797Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.263797Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:df730505425ec1af33c519d94abf63f7d426c81c2b42e3892b3279a2a336ef67","observation_id":"9d5cd095-d0e9-48e6-a1e3-b29ad38f1891","resolution":{"observed_at":"2026-08-04T03:22:12.263797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.427191Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.427191Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:0f2308c6064d673d2825c5b6ce90e68a1fc4d68e504928b3143a0a3e15a7e601","observation_id":"42fa0ded-ec24-40af-8086-3e293c9637bb","resolution":{"observed_at":"2026-08-04T03:22:12.427191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.537300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.537300Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:ed3b7f470ae5c67576e34516de292c0e0fd15923d15d3048caad21d4e469833c","observation_id":"85cf3a1e-6ba3-499d-b882-f56d83231148","resolution":{"observed_at":"2026-08-04T03:22:12.537300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.693033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.693033Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:16699c1896b7f328da1757d0dab7f312e29629df9b87ae9223580dd206e3cf38","observation_id":"10a34d74-fcd8-4d3b-85cf-b45a43142cbe","resolution":{"observed_at":"2026-08-04T03:22:12.693033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.786867Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.786867Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:7711a96c11d6fd11925248d619cf58e13d5d570677aab9f71c7016d7f26927ef","observation_id":"83c3516d-1d32-430c-8e2c-5f2bfa47dc9f","resolution":{"observed_at":"2026-08-04T03:22:12.786867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:12.894951Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:12.894951Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:695429ecd2d800d0976ade0b32a57cec39e950d817ff8a94f8ffef8595e78de2","observation_id":"4c492d79-1808-4bc5-abbe-c53d98a34e78","resolution":{"observed_at":"2026-08-04T03:22:12.894951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.000847Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.000847Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:90275c1fafb6f7dcbcb88ac076549a263bdfa5fa5874b406c34eb2866ce64a73","observation_id":"cbb9e6e1-fcd6-4cef-9143-45435a93bd73","resolution":{"observed_at":"2026-08-04T03:22:13.000847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.017766Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.017766Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:24a27409cb7f7647b3dbe2abd2111d6f4e34c98524992c11de1aeefc083c1d93","observation_id":"c0dff2dc-388e-4b7c-8144-0c8cdbe15379","resolution":{"observed_at":"2026-08-04T03:22:13.017766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.072027Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.072027Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:6ee76354b073adbe677036edf3de0165f5db3285714492c1d02441a0e15021de","observation_id":"75d4acb4-98e5-49f7-bcb7-02e28050e88b","resolution":{"observed_at":"2026-08-04T03:22:13.072027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.181141Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.181141Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:d333fbfdd0c4dd45c0a9f44472bea392974ea15ba1affee5e15f27ccec21f15f","observation_id":"b38b1434-8575-4419-a8a5-90cc621c1140","resolution":{"observed_at":"2026-08-04T03:22:13.181141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.277872Z","title":"Girshick, and Jian Sun","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.277872Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:3d567348248323dbc1f5fa7458b65207f76212127e0ef46a3979da53d8f3d02e","observation_id":"10b4d30e-c1fc-4823-a438-3c305649a415","resolution":{"observed_at":"2026-08-04T03:22:13.277872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T03:22:13.389549Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.389549Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:5805af1021181be106e55418966f82c808aae85404e04c1450c4f357e04716e6","observation_id":"c6bbd66f-604a-4e21-b07a-fff5f7b8c647","resolution":{"observed_at":"2026-08-04T03:22:13.389549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T03:22:13.403706Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.403706Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:ea416dc31ffef5f7547f0be3e1cc9a4c0e659a162ab9a8d12040fd0259fba87a","observation_id":"7b862218-86d7-4910-baed-d42515f6dcaa","resolution":{"observed_at":"2026-08-04T03:22:13.403706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.407724Z","title":"Chen, Shuicheng Yan, Xulei Yang, and Xun Xu","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.407724Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:6347e836dcc039be475fe54c41417e044b2457512f53b8543c6c2ac9ea4fb09f","observation_id":"ac5c3528-5ec5-4cd3-89cd-1b78bb424377","resolution":{"observed_at":"2026-08-04T03:22:13.407724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.412202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.412202Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:5ee9e74a72fc01107c53124cd7154717c51cf3f12e1a296b0784f85cfc26ebab","observation_id":"d1afe8d0-5bae-4443-bc4f-687789257ef8","resolution":{"observed_at":"2026-08-04T03:22:13.412202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-04T03:22:13.415678Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.415678Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:8407b46d73d168e9c30e32a18867907aa462a99d6e77f7b905572d323fbd9a43","observation_id":"1fde44fd-7f07-4abf-bd90-5dfa852584f6","resolution":{"observed_at":"2026-08-04T03:22:13.415678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-04T03:22:13.419357Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.419357Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:79dec52d191e550687632be0627928b2c9297e68f61bc22457ab3088e12738e1","observation_id":"33e4f02a-0f65-4081-9d92-dd2377f1b65b","resolution":{"observed_at":"2026-08-04T03:22:13.419357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.423086Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.423086Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:1e4b8378059341ca5ada3d29d42d6e8ea9c713692d6487494cba1d5b70a23527","observation_id":"d70f1bb8-8e51-416c-92c9-de94debc53c6","resolution":{"observed_at":"2026-08-04T03:22:13.423086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.426661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.426661Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:bcbfff6088a8db8a4f90a9942606ea4b3266b5e807217f06a1d4db5dd1aa7689","observation_id":"8c73b1e9-9c59-4452-8339-0d06e63aa589","resolution":{"observed_at":"2026-08-04T03:22:13.426661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.433253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.433253Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:bf42dfb4504bf90428a33811432e284214c5f7b3747dfb72b18c7227d81e41b2","observation_id":"60e668d0-c6bf-4620-bb4b-cba12f283345","resolution":{"observed_at":"2026-08-04T03:22:13.433253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-04T03:22:13.440881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.440881Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:b7ed3500cf9b2cf92136fada4715d5f130e48aebff09c303ff059930b871fe38","observation_id":"b7548687-e613-43d7-adb0-815d124dbe61","resolution":{"observed_at":"2026-08-04T03:22:13.440881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.445389Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.445389Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:c772cbfd0fc558241314377a9f34120814bf27cdcd4d762de18d991b7431c9b8","observation_id":"8c313408-e7ba-46a0-94e9-5759e1870b06","resolution":{"observed_at":"2026-08-04T03:22:13.445389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.449004Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.449004Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:8b0742de5a60848f3aecece0bc41184511bf68a7d87fee0c833829b64e4d8e22","observation_id":"f1886b4b-a2c1-4fbb-8ee1-336dbfdb4932","resolution":{"observed_at":"2026-08-04T03:22:13.449004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.452412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.452412Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:8dc9c9d1361092de57349c5d1e9656c984620389f458a149afa8ab61a3d78912","observation_id":"3d6fe268-aa9d-48df-95a5-7e93752eb3d3","resolution":{"observed_at":"2026-08-04T03:22:13.452412Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.455874Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.455874Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:ca93434ccf4a37f5dfb514b6eaff02dd5365bef8059a1fb438180faa00e3e9ab","observation_id":"c527fc35-e40e-4e7d-a161-a1d1fd544c97","resolution":{"observed_at":"2026-08-04T03:22:13.455874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.459160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.459160Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f60637e5e9d8def99a3d75a50523a142a52e25e160d8bbf3f371abd8d634da96","observation_id":"052d55a3-68b0-45a0-b674-45a41723dd03","resolution":{"observed_at":"2026-08-04T03:22:13.459160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.462358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.462358Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:9aeeb5390a081f49e704cb96420c33d064880dda130880ede3715e0bc2a40c9d","observation_id":"254765ab-daf6-475d-bb51-6a7b64df5fc3","resolution":{"observed_at":"2026-08-04T03:22:13.462358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.465686Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.465686Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:59b2a1950633b521071d3f82b676db010952f965c6fb947b40d406b0bf4f5cbd","observation_id":"75047152-3733-4929-a601-e7669280f211","resolution":{"observed_at":"2026-08-04T03:22:13.465686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.469127Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.469127Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:2eb1f13f608b02204b40527ff1800eef75e906ac73fe1c72fdf77b6902ebba42","observation_id":"23132b0d-f6e9-4a5a-83b7-3f619d0d40cd","resolution":{"observed_at":"2026-08-04T03:22:13.469127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.472887Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.472887Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:5e9a7bd1fab2bef9b96ecc0765fbaa16edbc4c02c7a65bd5b4b2ce505e671ce7","observation_id":"05e5db74-957a-43d0-82da-a75d53475e70","resolution":{"observed_at":"2026-08-04T03:22:13.472887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T03:22:13.476296Z","title":"text\"]. SYSTEM：You are an expert system specialized in scene text spotting, with performance exceeding that of human experts. ASSISTANT：There are N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.476296Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:a8cc820ab96ecf40e8e48e166e971d4cf07d21db889c05b901661c21d07f9f57","observation_id":"bbb46ea2-6612-40c0-aefb-4b35304dcfbc","resolution":{"observed_at":"2026-08-04T03:22:13.476296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:13.436757Z","title":"doi:10.1609/AAAI.V34I07.6896","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:13.436757Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:130f46017c29d40666ebfb35f5eee6d45e24a4acd2eeda450c85c8665ec5ab80","observation_id":"5dad74da-3e23-4e3d-a438-b525d8e2062f","resolution":{"observed_at":"2026-08-04T03:22:13.436757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-04T03:22:09.139190Z","title":"arXiv:2306.15195 doi:10.48550/ARXIV.2306.15195","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.139190Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:f485b53779183b991e3a46b73512d20ec910bc3a308b603a742ecfa5da0bdcb0","observation_id":"7e46ca2f-3e54-4aad-b826-50a5e1c32bd6","resolution":{"observed_at":"2026-08-04T03:22:09.139190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T03:22:09.738175Z","title":"arXiv:2510.14528 doi:10.48550/ARXIV.2510.14528","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T03:22:09.738175Z"},"links":{"citing_paper":"/paper/2607.27902"},"observation_digest":"sha256:076ad9d2ba6c9c964e9d82dcd3902b87de1b4bd8d74632268bd28f1e1daf1f5b","observation_id":"9d31c732-9469-4766-8886-f54686eba420","resolution":{"observed_at":"2026-08-04T03:22:09.738175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27902","last_updated":"2026-08-03T05:25:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T11:22:19.886685Z","submitted_at":"2026-07-30T09:17:48Z","title":"One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.27902."}