{"as_of":"2026-08-07T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52ddc09276f503ea1d8275520a2c223827ef6562be58ad678ddf9c6084f17aea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:18.799068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:59:57.589641Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"1907.00490","last_updated":"2019-06-30T22:46:11Z","snapshot_observed_at":"2026-08-03T04:51:19.980926Z","submitted_at":"2019-06-30T22:46:11Z","title":"ICDAR 2019 Competition on Scene Text Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T12:16:41.394335Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/1907.00490"},"observation_digest":"sha256:18e209b0c735724aef4a2cb082dd1b1243cf0b7ba77f207bd0890134f1aded71","observation_id":"b0e48bf8-6017-43ec-85aa-2b686cbdaa99","resolution":{"observed_at":"2026-05-25T12:16:56.500827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"1907.00945","last_updated":"2019-07-01T17:30:31Z","snapshot_observed_at":"2026-07-06T08:04:11.161145Z","submitted_at":"2019-07-01T17:30:31Z","title":"ICDAR2019 Robust Reading Challenge on Multi-lingual Scene Text Detection and Recognition -- RRC-MLT-2019","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T11:51:09.915069Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/1907.00945"},"observation_digest":"sha256:0a2c23b0d3403ff4b8b8b37cb26fb865aafb07976b2fb745689d75d82cffb8ed","observation_id":"3c2775f6-b66b-4c10-a044-f4cdd37bca1b","resolution":{"observed_at":"2026-05-25T11:55:46.040781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"1907.06119","last_updated":"2019-07-13T19:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-13T19:23:42Z","title":"Understanding Deep Learning Techniques for Image Segmentation","version":1},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-24T21:46:17.736097Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/1907.06119"},"observation_digest":"sha256:7e9fa5e763c48e315ba6ec93cb99bfd9b3f900b634e27b078ea0595e4bd67e9c","observation_id":"a1b33149-6c26-421f-bfc4-a3ad6aac0d78","resolution":{"observed_at":"2026-05-24T21:46:24.322680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T09:55:35.452649Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2305.07895"},"observation_digest":"sha256:c7c223d1d983dae5eb75b0e42bc97b264f97744609f973765a2087562a61d587","observation_id":"f2d68b78-65dd-460f-9954-608872ca8435","resolution":{"observed_at":"2026-05-17T09:55:35.647328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:a9949c302b9af7294bbcaa172391e09b80e7af7dc77aec157407302ea2478fb4","observation_id":"d3f9527f-2649-430e-ad27-35004440544a","resolution":{"observed_at":"2026-05-12T20:58:59.223609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T20:50:57.814634Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2409.01704"},"observation_digest":"sha256:2db636fa43eeb6af608e485d4995181373cd5f4790c0dfc170ed12b9f3454020","observation_id":"891e267d-cfe6-4107-95fd-e32739877243","resolution":{"observed_at":"2026-05-17T20:50:57.882154Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:83713aa90c1ad4b83f0930e3e06f5fbd91c1a1c4d330e39624229c9777dce6b5","observation_id":"ceac8f92-154a-4c3a-bc42-408b61aedd69","resolution":{"observed_at":"2026-05-23T19:15:47.131840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:48a1ade504acad55b6dc15e080b5850c4b4712b44cdd9487fe15a64ff22ad6c6","observation_id":"b5a23ac5-b373-4f51-9a82-df50d4e20459","resolution":{"observed_at":"2026-05-10T13:23:58.078687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c65439af86b850ca57e14c5dca3ef69bb83d658981e35c4bb9ecd3c928f1734c","observation_id":"c0d259c6-f13f-4a01-86bc-96ac9a44bcdf","resolution":{"observed_at":"2026-05-17T20:33:26.841117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:96d7f8f5686adb337cfe30b0096e72dfc327343320f6cca3f9b4e30f031da6d2","observation_id":"ff8a32bf-64c8-4c88-b81c-c4f14956c305","resolution":{"observed_at":"2026-05-11T01:19:59.854550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2506.00721","last_updated":"2026-04-04T02:19:01Z","snapshot_observed_at":"2026-07-30T08:35:22.353423Z","submitted_at":"2025-05-31T21:42:12Z","title":"Common Inpainted Objects In-N-Out of Context","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T11:38:44.069681Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.00721"},"observation_digest":"sha256:abf3f3fd3ca00c86b4819705eeca0f936dcc87f5a40a0de18bcbe15ddc9c946e","observation_id":"7e25e0db-a2aa-4f31-ad3f-0b9db62cb526","resolution":{"observed_at":"2026-05-19T11:42:15.985486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T10:35:18.799068Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.799068Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:388e72841585dc929eacf487dcaea0a18703b13ee4d2138c5c700b5ad87a0876","observation_id":"9c75f9be-642d-4630-9ee1-dfe1a9b78f60","resolution":{"observed_at":"2026-08-07T10:35:18.799068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T06:02:30.447765Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-07T05:54:42.681893Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.447765Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:b336ea267c47e6bd1f9a3fe15e2a56ab06f3f8099ac32ae3e3057ce7b7c5dcbb","observation_id":"a1f5b464-6f14-461f-aedd-9d6cbb42dc60","resolution":{"observed_at":"2026-08-07T06:02:30.447765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T05:56:47.198137Z","title":"In: arXiv preprint arXiv:1601.07140 (2016), http://vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06761","last_updated":"2025-06-18T10:34:41Z","snapshot_observed_at":"2026-08-07T05:47:44.895846Z","submitted_at":"2025-06-07T11:05:33Z","title":"The OCR Quest for Generalization: Learning to recognize low-resource alphabets with model editing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:47.198137Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.06761"},"observation_digest":"sha256:3f2a6e586264d829d565e3ebbc60723e8bdbd8b373f238a9f85a66471c5636bb","observation_id":"8dc194d2-09e1-4148-9fc2-d0f05267d9e5","resolution":{"observed_at":"2026-08-07T05:56:47.198137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:dced371ab800b6717eb05ce7c181286b7350fc2f36af6efc7acd6689fe5a7fc7","observation_id":"2c669783-fe6d-4e56-ba56-abe50041330b","resolution":{"observed_at":"2026-05-19T11:13:02.871922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T04:41:09.684861Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09993","last_updated":"2025-07-03T06:39:43Z","snapshot_observed_at":"2026-08-07T04:33:16.314362Z","submitted_at":"2025-06-11T17:59:46Z","title":"Text-Aware Image Restoration with Diffusion Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:41:09.684861Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.09993"},"observation_digest":"sha256:dc2e5b2cc430e9ffed566412c5798493269ce220143415206a3f70c4e29ecabe","observation_id":"7c9bffc3-6d5d-43bf-a0dd-5ee482b6adcc","resolution":{"observed_at":"2026-08-07T04:41:09.684861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-06T16:50:01.817911Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.817911Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7616711d520ec6edb9370f2c634cefc391675b62998e360f142038b5de84fc1d","observation_id":"0ec19cce-6c0a-4f41-be1e-fd52bd161f61","resolution":{"observed_at":"2026-08-06T16:50:01.817911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-06T05:56:41.210900Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.01153","last_updated":"2025-08-02T02:28:09Z","snapshot_observed_at":"2026-08-06T05:56:40.324075Z","submitted_at":"2025-08-02T02:28:09Z","title":"TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:56:41.210900Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2508.01153"},"observation_digest":"sha256:2e4ecc0de0548dd4ebd2c4f10b66c78767a85449cc43a443fdf2209e6db63889","observation_id":"97908528-2ae1-4860-b546-9b39ae56d97e","resolution":{"observed_at":"2026-08-06T05:56:41.210900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:31e83235b79a840203eb7c656039ad8bfb648fb17c2d3e25ba95409983ce27d0","observation_id":"9dd17bb6-5565-460a-877d-4c48c67a0989","resolution":{"observed_at":"2026-05-18T01:40:42.478766Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2604.00161","last_updated":"2026-04-21T01:45:08Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T19:09:55Z","title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:53.449935Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2604.00161"},"observation_digest":"sha256:5964e33d6669867870a0cf981c938881c93f1de3df454e199dcd9b1be0ccb82a","observation_id":"fce723f1-2789-4248-8839-cba58936be48","resolution":{"observed_at":"2026-05-13T23:33:26.739428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2604.17941","last_updated":"2026-04-20T08:21:06Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:21:06Z","title":"From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T05:44:37.891638Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2604.17941"},"observation_digest":"sha256:f76d5d73e09dff023f8a7e2c811ee59bcc9caa85cf69c28581c349623e068ee8","observation_id":"71879820-a1a8-4150-a37f-9f8433f58ba0","resolution":{"observed_at":"2026-05-10T05:46:10.153453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2605.17309","last_updated":"2026-05-17T08:02:20Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:02:20Z","title":"StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T14:30:06.831024Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2605.17309"},"observation_digest":"sha256:a286eef7a47fea597085c60d361e9cc5056629d7d26dd76ddba793c3dc2ac772","observation_id":"f3710646-d8aa-44e9-8a29-42a9389dd5c0","resolution":{"observed_at":"2026-05-20T14:33:21.527196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2606.21113","last_updated":"2026-06-19T05:32:30Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T05:32:30Z","title":"Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:49:39.520109Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2606.21113"},"observation_digest":"sha256:b04fa233341e934a9bf0b364c4ad188b835469af5b7d479679048ca5ab39469d","observation_id":"fb39db39-42f0-4991-a859-0d22e6914ac3","resolution":{"observed_at":"2026-07-04T06:09:37.450126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2606.25084","last_updated":"2026-06-23T18:44:59Z","snapshot_observed_at":"2026-08-06T08:49:23.923396Z","submitted_at":"2026-06-23T18:44:59Z","title":"Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T00:07:54.919001Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2606.25084"},"observation_digest":"sha256:3d2ea9111f1d0428a82d69ab42d19b94d0565ad22748cb260e630b55534f3287","observation_id":"af31b272-419c-4b86-aa21-0a198f7202e9","resolution":{"observed_at":"2026-07-04T16:59:57.594886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":291,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:08ecebf2ffcf2cc03f8a78da05fb62b9e9467b5df4f464d606b94118c1767eeb","observation_id":"79b53422-c0aa-4c16-abcb-d74633c8a260","resolution":{"observed_at":"2026-07-01T15:45:47.653390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":291,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:fb49e7d7a8d9d20490b0036170cafc7fa308460d3487dd66aa448d96d22da33b","observation_id":"1ddba967-edfc-4ccb-a0c7-1196f832b557","resolution":{"observed_at":"2026-07-02T21:17:23.965840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":"1601.07140","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-04T16:59:57.589641Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":"cs.CV","work_id":"ea6ff5e9-689c-41f0-921f-ad32f5e27198","year":2016},"citing_paper":{"arxiv_id":"2606.31991","last_updated":"2026-06-30T17:29:04Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:29:04Z","title":"Amplifying Membership Signal Through Chained Regeneration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T06:22:08.140403Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2606.31991"},"observation_digest":"sha256:3753dc77111bb2ee03431183d38458734b71cb0bcb96d1e96a100ab88f2bba96","observation_id":"4b34ba75-39d5-4d50-bce0-1e922401e3ee","resolution":{"observed_at":"2026-07-01T09:35:41.144448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:1601.07140 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:6c690b9ab39ecb0b7a1579d429e4ea7273183316ebe33ccae2b92c9f096f8fb7","observation_id":"92b91896-923d-45ec-94d7-5b4240056c52","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images.arXiv preprint arXiv:1601.07140, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-01T13:32:56.102037Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:08c322acd12e8cb44309315087c7d76678ffda90ef17e35914396067a19f7c84","observation_id":"37898c0a-39d9-4720-9c59-a082d52ccf1d","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-01T16:31:11.237847Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-02T14:43:28.084412Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.237847Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:edf258635ede24d2d54934519a559504f7cdbfb08533c2339e9d1ebf25114a96","observation_id":"aedb5422-ff5a-47ce-84cc-1f9660204bbb","resolution":{"observed_at":"2026-08-01T16:31:11.237847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1601.07140/citation-record","integrity":"/paper/1601.07140/integrity","json":"/paper/1601.07140/citation-record.json","paper":"/paper/1601.07140"},"outbound":[],"paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:1601.07140."}