{"as_of":"2026-08-08T23:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32b5a00c85ad14841de417b4f9f0f85c4e6054dd7375441ae351e3ef034f8fa6","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:34:03.546459Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:51:08.895411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04999","snapshot_observed_at":"2026-07-12T05:51:08.895411Z","title":"Beyond cropped regions: new benchmark and corresponding baseline for chinese scene text retrieval in diverse layouts.arXiv preprint arXiv:2506.04999, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02956","last_updated":"2026-07-03T04:59:12Z","snapshot_observed_at":"2026-08-07T13:31:06.512405Z","submitted_at":"2026-07-03T04:59:12Z","title":"MORE: A Multilingual Document Parsing Benchmark and Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T05:51:08.895411Z"},"links":{"cited_paper":"/paper/2506.04999","citing_paper":"/paper/2607.02956"},"observation_digest":"sha256:d9859641743dba9a89c3b6b7481abfae6d1e39d7b6e3ae16418d07260c662317","observation_id":"dad30a42-fba3-4c1c-b7a1-f2edd0a12c4e","resolution":{"observed_at":"2026-07-12T05:51:08.895411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04999/citation-record","integrity":"/paper/2506.04999/integrity","json":"/paper/2506.04999/citation-record.json","paper":"/paper/2506.04999"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.365076Z","title":"Word spotting and recognition with embedded attributes","venue":null,"work_id":"9a29b728-ac6e-430f-95ff-4bc9ce80a9d3","year":2014},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:54.768761Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f011ac8681a3daeb1e56b78f9c62e1337b4f08289789ad8d720656e1219a7338","observation_id":"19b7fbcd-7a0e-47a9-91ed-980b563b0049","resolution":{"observed_at":"2026-08-07T10:34:05.370790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.349146Z","title":"Integrating scene text and visual appearance for fine-grained image classification","venue":null,"work_id":"33e3c9bd-2bd4-4e94-b2c5-36552704ff5e","year":2018},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:54.851730Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:4c3aec2b4c06468579aab06a9c678778ffd534ffb4609f07e08719ddbeecf3f7","observation_id":"8d125acd-11c2-4932-a0cd-de2d8ac1427c","resolution":{"observed_at":"2026-08-07T10:34:05.355245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.333003Z","title":"Composed image retrieval using contrastive learning and task-oriented clip-based features","venue":null,"work_id":"e4f5c97e-2945-47b0-9aa3-15c778116de6","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.023632Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f03f2c44f1e61c6d1f932d7e563aacbee8487af87dfeb14494f8a95c1d204403","observation_id":"725917d1-32b0-4003-9e5d-048aed65f324","resolution":{"observed_at":"2026-08-07T10:34:05.337860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.317430Z","title":"The devil is in fine-tuning and long-tailed problems: A new benchmark for scene text detection","venue":null,"work_id":"43dcb38f-3caf-4fff-b5ec-5facce729f58","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.221307Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fabfd4fad1b741deb9746083d0ed03d87b33195a7a059eea3f217a6a1cbfab81","observation_id":"6ab1ddc1-e6d6-446d-bdd9-94d793bc8a99","resolution":{"observed_at":"2026-08-07T10:34:05.322419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.301728Z","title":null,"venue":null,"work_id":"965e61a8-88e4-4573-bf7e-973d443c719c","year":2017},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.383782Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f20e1668e2059456fed5fb8424249ad59c4474c8865b195d14a486a3f3afa882","observation_id":"a9ecefec-40c7-452c-aad5-9d1010d67940","resolution":{"observed_at":"2026-08-07T10:34:05.306842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.284118Z","title":null,"venue":null,"work_id":"853d254f-66eb-40fb-9288-c33615514c3b","year":2015},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.567461Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:7b80fb0da757e5d3985a9264530ed1371bbae8bc8f72152d55e5eb4a795cfe78","observation_id":"67c6b5b4-6b3e-42ad-893f-1766c4ca0c3c","resolution":{"observed_at":"2026-08-07T10:34:05.289434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.265014Z","title":"K., Gomez, L., Karatzas, D., and Valveny, E","venue":null,"work_id":"69a08f0f-d498-4b3a-8274-ab4ba6b1bf55","year":2015},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.750412Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:9aa8a307e988649f60109e850e9024fba3f90f38b1707c22e9793ce6d29751ac","observation_id":"7326a63d-173c-49bd-aa02-dfb3177080ea","resolution":{"observed_at":"2026-08-07T10:34:05.271142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.249779Z","title":"Lsde: Levenshtein space deep embedding for query-by-string word spotting","venue":null,"work_id":"772f7529-8460-42f2-ba27-65fe67a57bb4","year":2017},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.944990Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:db39a2eb22052fb744a23dfb590d01c5a43f52f4acbca70d0b7b76a8ef972b3c","observation_id":"d77fb228-da44-412e-94e4-46a9daa8bf59","resolution":{"observed_at":"2026-08-07T10:34:05.254671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.234216Z","title":"Single shot scene text retrieval","venue":null,"work_id":"d5bb6d76-9ac3-4fb8-ab92-7459a6cb1d4c","year":2018},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.079254Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c763015a0b6b63b0bdac042e240418ded5df6776decea74fe6cd0804c828dd1e","observation_id":"967183e2-ec4b-478b-b0b5-0e00341d3fc8","resolution":{"observed_at":"2026-08-07T10:34:05.239639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.218497Z","title":"Synthetic data for text localisation in natural images","venue":null,"work_id":"c85d7856-51ad-4340-a7fe-251bea97c58e","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.206032Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b3afc4a5bfcc71b1b02aad66d68082f442b0a7422af0a9989cf2863606ae592a","observation_id":"9c1f59e1-cfab-4ed4-b07b-eac0c396bfaa","resolution":{"observed_at":"2026-08-07T10:34:05.224142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.200804Z","title":"Bridging the gap between end-to-end and two-step text spotting","venue":null,"work_id":"fa1f5cea-0210-415e-a738-97323241bc25","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.368840Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:542179677b4b758144717b5184733833c526a603014b87da8bc1ae6bd41e8b6f","observation_id":"7c64ac95-9dbd-4e08-8110-2a4d52a8a483","resolution":{"observed_at":"2026-08-07T10:34:05.206480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.047598Z","title":"Reading text in the wild with convolutional neural networks","venue":null,"work_id":"ac42a8aa-dced-43c3-94db-b031eb30a5db","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.502105Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:d73df5b39a8060503c3c62dd1a5c98db83297fbb1718486eaff8d1efcc1f754f","observation_id":"55c12d19-33a6-49b6-895d-5f8a1cf31640","resolution":{"observed_at":"2026-08-07T10:34:05.052301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.031853Z","title":null,"venue":null,"work_id":"4911ccd3-9602-46a3-bd5b-50742d712c61","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.685119Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:24c14f9740029bb3ed222d738ac81c2f3f95dff5609a454c02f1c522b39e5269","observation_id":"b8e8a25f-ff91-4dea-a15b-86c46a14cfcd","resolution":{"observed_at":"2026-08-07T10:34:05.037243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.015065Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"79a44126-f98a-4932-aa44-e7e8d2dc77c1","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.792242Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:00eff879aa05a87b2ec2db33a96af7b2a43df294a1b44d9a9d83dbb828b483c8","observation_id":"8ae8f700-b529-44ad-89e1-e9cc258ebd46","resolution":{"observed_at":"2026-08-07T10:34:05.021425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.998049Z","title":"Mask textspotter v3: Segmentation proposal network for robust scene text spotting","venue":null,"work_id":"b147ffee-cca8-427e-a05e-5513260e6038","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.915356Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:8d4d5d3df49f032403d0d3b35e284feaf24003f38f07f0dda711e9dff5ee1111","observation_id":"09dc5171-96f9-4610-aa75-d5a0d8a44054","resolution":{"observed_at":"2026-08-07T10:34:05.003389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14232","last_updated":"2024-02-01T13:06:51Z","snapshot_observed_at":"2026-07-06T17:06:50.350562Z","submitted_at":"2023-12-21T18:46:46Z","title":"Parrot Captions Teach CLIP to Spot Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14232","snapshot_observed_at":"2026-08-07T10:33:57.108940Z","title":"J., Wang, B., Li, W., and Shou, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.108940Z"},"links":{"cited_paper":"/paper/2312.14232","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:6abb90308cc41ab32d6629a3b2bd1cfb0e01924e5d3e7bbb6609105bef8f912d","observation_id":"9bd96913-088a-4be8-9437-307444e8fa51","resolution":{"observed_at":"2026-08-07T10:33:57.108940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.981060Z","title":"Abcnet: Real-time scene text spotting with adaptive bezier-curve network","venue":null,"work_id":"c36de1d5-0837-43ee-a307-bba644281c6b","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.275665Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:7c05f894812afaeabfdcbf108136128b06ac0e11fe4a460fed8aaa5ec3721990","observation_id":"a0e84eb5-63f5-4cce-abd7-ad5238686dfc","resolution":{"observed_at":"2026-08-07T10:34:04.986619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.963535Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning","venue":null,"work_id":"efdcac01-4e85-48f5-95ab-e695ac2beedd","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.405128Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c66688b9f2250f44d3c29aebe452ac811a45c864a0a3d5f3849c26e61657ac44","observation_id":"3394719f-ae53-4136-8686-c37337185e42","resolution":{"observed_at":"2026-08-07T10:34:04.968964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.945994Z","title":"Visual and semantic guided scene text retrieval","venue":null,"work_id":"5c54dc46-b7b8-4f50-8e6b-aacd91333c5a","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.566552Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:5e59fc8ac09f5887abca5af133d865d196d1f8450ec29834ade9c6995d52b0a7","observation_id":"a6f5e436-a131-431e-9444-31d7188beb4e","resolution":{"observed_at":"2026-08-07T10:34:04.952098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.929444Z","title":"Arbitrary reading order scene text spotter with local semantics guidance","venue":null,"work_id":"6baa8111-a9a9-42fe-bebb-363575f65b61","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.698449Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b900f7840567a843e46a30f58f901488df377da89b39e4cb3533867b1b4cc7e7","observation_id":"1290ac95-3c8d-498c-8fba-e6136ab610f2","resolution":{"observed_at":"2026-08-07T10:34:04.935312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.910723Z","title":"TextBlockV2 : Towards precise-detection-free scene text spotting with pre-trained language model","venue":null,"work_id":"de312c2b-f5b3-4ae3-b2f3-3181d04c29d2","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.885055Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:e36cf65858a2cf2f428ce31a57598a95a73f21a3e9f45f866e52074a3905efd4","observation_id":"ca4dca92-f899-4c60-a392-a58de153c75d","resolution":{"observed_at":"2026-08-07T10:34:04.917434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.890127Z","title":"F., Gomez, L., and Karatzas, D","venue":null,"work_id":"7bf8c5a6-7d4f-4ddd-9e23-347278c352c3","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.018490Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fce627c0057d92d093b281f2db9b30b8ea2649b45b47d33f6cbcdafae95d972e","observation_id":"67d2aaff-0a84-42d9-97d3-b142b693894c","resolution":{"observed_at":"2026-08-07T10:34:04.896657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.873894Z","title":"Real-time lexicon-free scene text retrieval","venue":null,"work_id":"f8cd93b1-89c8-4ad4-a580-65bfa7cb6582","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.137410Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c325d0f0014d05a70c6e7779b53ee7b30b6559ebde2ace3089dcd65c4ba74ef9","observation_id":"adf89f9b-e367-484c-a52c-d6b0c15db0ad","resolution":{"observed_at":"2026-08-07T10:34:04.879134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.856143Z","title":"Disentangling visual and written concepts in clip","venue":null,"work_id":"248ecc1b-4ca0-4bd1-9f95-99fa21892a2b","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.298068Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:d1c772bdedf12699fd669da043064c152d088a472836648949e3f003b91d0389","observation_id":"9a27e253-a92b-4800-904f-084ab52987a0","resolution":{"observed_at":"2026-08-07T10:34:04.861704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.839013Z","title":"Word spotting and recognition via a joint deep embedding of image and text","venue":null,"work_id":"8d392a9b-2770-4416-9440-5cee6f6ee1cb","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.501734Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:a5f113c22a513aa010746a20e98456117b18d816165cd1ecb45a71e12aabc6e7","observation_id":"0fd555bc-2131-47b9-91f9-7effe32c3009","resolution":{"observed_at":"2026-08-07T10:34:04.845036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.816462Z","title":"Image retrieval using textual cues","venue":null,"work_id":"ed085ef3-0594-485f-a35a-bcc36129742d","year":2013},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.633790Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:04772a7ce578adae471f298972d97d87300e3db233826e5d2fd0b0c704b2b072","observation_id":"494d4877-9c19-4f90-8df1-26544445e99c","resolution":{"observed_at":"2026-08-07T10:34:04.824192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.793866Z","title":"Text perceptron: Towards end-to-end arbitrary-shaped text spotting","venue":null,"work_id":"20213d23-92dc-4056-886e-562490c233bd","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.756760Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:4c0b30fe833ad7355f2a6fb42b87b1cf4ac182a71a8b5b73c43cb397a75d8781","observation_id":"43fdc69e-fd6a-441f-96d4-c51a7af8dabd","resolution":{"observed_at":"2026-08-07T10:34:04.800334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.770934Z","title":"SEED : Semantics enhanced encoder-decoder framework for scene text recognition","venue":null,"work_id":"bc9d95c7-5a20-4e1d-be64-cbba7647f11d","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.932601Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fc082afe243f1177267c03c98655aefefbe1dcb37e8ccab625deefa91c11086f","observation_id":"33c759fe-ff90-40e3-899c-695a9e8c2622","resolution":{"observed_at":"2026-08-07T10:34:04.777621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.751704Z","title":"PIMNet : A parallel, iterative and mimicking network for scene text recognition","venue":null,"work_id":"31621fd2-7f71-41e2-ac1b-7c21645191e7","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.113247Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:feac51a1c7acefbb36a340352a7b08e8f197924a1ffad62c914d71129e88548f","observation_id":"26669bf7-34ac-4dc0-9a7a-bb1f1fda7196","resolution":{"observed_at":"2026-08-07T10:34:04.757899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.732640Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":"5d0371ed-ee4d-4122-9912-3a6052ee13e9","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.311002Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:78f3667bd2638d8ff5492a19594f70631d3de5e0d8fa38940d7b7dfed187779f","observation_id":"c812f105-6f83-4140-90a6-86a2dcbe04b7","resolution":{"observed_at":"2026-08-07T10:34:04.739445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.714859Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"d9a5efa9-0f85-4d4b-ad0c-f488ab527f90","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.490623Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:9c5744af9da93fc2b55d6c3a14ef40bac413470915deb2338a30f790b00005a3","observation_id":"29099d5c-5d3b-49fd-8f8e-2455b3566cfd","resolution":{"observed_at":"2026-08-07T10:34:04.721235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.692774Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"6e2a5871-42d0-459b-83c4-fd96404906db","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.630256Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:9d7ae17404d83133a8a2fa895b287d12ad52062718aca399a0c04c0e66115cc1","observation_id":"3193a5a6-dac0-43c3-8005-6a8100dfc4d0","resolution":{"observed_at":"2026-08-07T10:34:04.700159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.670736Z","title":"LDP : Generalizing to multilingual visual information extraction by language decoupled pretraining","venue":null,"work_id":"9bb4a12a-efa6-423a-aee1-1bfe6de34ea0","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.737394Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:a450a38b9f32314182a17096484344d3d0eb9ce65c4500e86bccdaa07756df25","observation_id":"d5948cc0-dc9a-4651-a9cd-0024258b43a4","resolution":{"observed_at":"2026-08-07T10:34:04.677264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.649852Z","title":"and Yang, S","venue":null,"work_id":"db3aef22-8022-4aa4-b20b-d08a624074de","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.865196Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:00d982cbee9225e2a4cb01f34dcbc91caf7b65eabbd35d219e4e5957e93ae3b0","observation_id":"36a0a6c3-4e20-452e-bf5d-7be37736e743","resolution":{"observed_at":"2026-08-07T10:34:04.655824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.628306Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"11e01cc9-51fc-41fd-be28-580f0607975d","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.999588Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c62e2cda8e3ee812cbd2fe4688034523de3799b38aa2fbc2efb0ec0a661e9fee","observation_id":"bb09becc-0361-4559-98c8-9d9091963ae1","resolution":{"observed_at":"2026-08-07T10:34:04.633680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.606291Z","title":"Perceiving ambiguity and semantics without recognition: An efficient and effective ambiguous scene text detector","venue":null,"work_id":"a32be403-cdc9-4514-af39-d30bc3479868","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.150960Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:a20be978e54c62889cc631526c88802f822af32bff1d2eb9037ee5409b24aa6c","observation_id":"3b8b2a52-613f-4fa0-b765-416e8b945def","resolution":{"observed_at":"2026-08-07T10:34:04.612274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21682","last_updated":"2025-06-05T18:59:02Z","snapshot_observed_at":"2026-08-07T15:57:54.245015Z","submitted_at":"2025-04-30T14:19:29Z","title":"Visual Text Processing: A Comprehensive Review and Unified Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21682","snapshot_observed_at":"2026-08-07T10:34:00.263138Z","title":"Visual text processing: A comprehensive review and unified evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.263138Z"},"links":{"cited_paper":"/paper/2504.21682","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:1f1b4f01f95be59ba816c379d441948339183cfc2c863641d5f9f3d6c000dcc9","observation_id":"7582d782-bcc6-4193-a654-25ce888f7cbe","resolution":{"observed_at":"2026-08-07T10:34:00.263138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.587330Z","title":"Text siamese network for video textual keyframe detection","venue":null,"work_id":"5b934c5c-cd66-4e78-9d14-f5e566a1db19","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.423634Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:77f566dca7e38d1c7fbff548d1c6e025e24a2a10b2d76c7d28c7da3afa32f62f","observation_id":"8afb498f-98dd-4c1a-a222-54ea38e52ad3","resolution":{"observed_at":"2026-08-07T10:34:04.592910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05991","last_updated":"2022-05-02T20:08:17Z","snapshot_observed_at":"2026-07-06T12:59:42.661935Z","submitted_at":"2022-04-12T17:55:38Z","title":"ReCLIP: A Strong Zero-Shot Baseline for Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05991","snapshot_observed_at":"2026-08-07T10:34:00.550841Z","title":"Reclip: A strong zero-shot baseline for referring expression comprehension, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.550841Z"},"links":{"cited_paper":"/paper/2204.05991","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:02dbb966b8351d8cb32b7d36e1c6f6271386325fa302e0c76f5cfa43dd399e87","observation_id":"0b702319-8127-42fb-ab6a-b59835d7f895","resolution":{"observed_at":"2026-08-07T10:34:00.550841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.562438Z","title":"Alpha-clip: A clip model focusing on wherever you want","venue":null,"work_id":"85c5ee0c-756b-412d-9baf-3afacea0de7a","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.739489Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b1e7ef59748ef9ffe99d3d2f882f847bb75375722637904d318d7a8bf8b90274","observation_id":"7bab5433-11c0-4b08-a4fa-649066da084a","resolution":{"observed_at":"2026-08-07T10:34:04.567265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.544778Z","title":"Scene text retrieval via joint text detection and similarity learning","venue":null,"work_id":"7ebfe522-3af6-47c5-8729-7a423ec759e2","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.863099Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:d9f629d299eb91e235c7f6367fada36772047a0d5466a318c9311e9c7b064ac2","observation_id":"6208d676-89e0-4553-b63e-49921c64e1d4","resolution":{"observed_at":"2026-08-07T10:34:04.550844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.525506Z","title":"and Belongie, S","venue":null,"work_id":"e959795d-4549-4e2b-bf06-957553406b4c","year":2010},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.975641Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:470c36ca63b678bb02941b8ca350e1f93a24b4ef35d427df35f80efc6b6f2e96","observation_id":"98b0e76a-9b63-4201-90b8-5e6fa7dcc40b","resolution":{"observed_at":"2026-08-07T10:34:04.533936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.503971Z","title":"TPSNet : Reverse thinking of thin plate splines for arbitrary shape scene text representation","venue":null,"work_id":"1879ca4e-723b-47a3-b50d-2ae87179fdef","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.158728Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:14155d67da54227b0cb2c29400a1fd64a3a8afc7699224d94c83dba30a47a356","observation_id":"0230ef5f-da59-4ce7-8441-fa8aa021f513","resolution":{"observed_at":"2026-08-07T10:34:04.509147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.486983Z","title":"TextBlock : Towards scene text spotting without fine-grained detection","venue":null,"work_id":"eb7b1047-f250-40a3-bb88-5576207b991b","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.308373Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:5ec10d79fc50ab9a647bc7baad7a840ba0dd40533cb68be35752b3901670f286","observation_id":"840cf871-9a2c-4b19-9ba7-38f7781a32d6","resolution":{"observed_at":"2026-08-07T10:34:04.492576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.468856Z","title":"Visual matching is enough for scene text retrieval","venue":null,"work_id":"f7c84e01-513c-46e0-89bd-46d1c9e2df12","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.467766Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:30e6214bb256d7daaee466a0067ae172d9128aca6fdc0278a5f4ca4758d4c812","observation_id":"05d1d8c1-31d6-442f-aadd-fb08bb350c8a","resolution":{"observed_at":"2026-08-07T10:34:04.475436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.447261Z","title":"and Brun, A","venue":null,"work_id":"2f18241e-4e04-4c7e-98ff-e0e1a2649c67","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.645696Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:830ec4c5141ea8990665c882a466dcda15a09fe3e71ffcab2bdb11bf4a1d2fdf","observation_id":"d868ad56-f596-4837-bcc9-a5ae60c5d046","resolution":{"observed_at":"2026-08-07T10:34:04.452994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.430076Z","title":"Bridging semantic gaps for language-supervised semantic segmentation","venue":null,"work_id":"eab8a742-e28f-4465-ab9d-3e04395d71c8","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.767073Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fda2c5f109aa3fba489b396b00da4cdf46e42f930544ebf9709e28cdae460de2","observation_id":"7787ef5a-3a50-4eac-af92-27cb0176e811","resolution":{"observed_at":"2026-08-07T10:34:04.434978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-02T21:42:25.156081Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-07T10:34:01.936414Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.936414Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:0648fc19037a62f832e5adab64709e3d75f91fcdf3088a0496cab6a18ce76428","observation_id":"f1967491-8899-4f2d-85a9-d16e43bfea0e","resolution":{"observed_at":"2026-08-07T10:34:01.936414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.408995Z","title":"IPAD : Iterative, parallel, and diffusion-based network for scene text recognition","venue":null,"work_id":"118ae3fe-f2f0-4dac-89f1-928f139229d3","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.139112Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f29139994b4e72d8b237881ee215424dd94fc81ea77493c78497deef5636b6cc","observation_id":"d672d0c0-2f1d-46bb-81ac-1a78f2cbf2ed","resolution":{"observed_at":"2026-08-07T10:34:04.415705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.386538Z","title":"Turning a clip model into a scene text detector","venue":null,"work_id":"0a6b1b76-0bb8-43b6-8057-13508e0118c8","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.295822Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:bd1f5b2f06a59ce5198c724a8420ef327425afa89130efe73a24de7efd39514b","observation_id":"329c6e7e-26df-4a66-af7f-658495b5cf18","resolution":{"observed_at":"2026-08-07T10:34:04.393041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.364001Z","title":"Beyond OCR + VQA : Towards end-to-end reading and reasoning for robust and accurate textvqa","venue":null,"work_id":"fce7ceb7-6254-4f36-9914-3716e2f81bff","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.427022Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:36ab09bbbe5a30d002e18bee98addfc0b9939c108bc62c8b7fbef01005dcaa44","observation_id":"ebecad2c-826a-4bac-b244-797a5e3837c7","resolution":{"observed_at":"2026-08-07T10:34:04.372619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.331584Z","title":"Focus, distinguish, and prompt: Unleashing CLIP for efficient and flexible scene text retrieval","venue":null,"work_id":"4c00ec4e-c43b-49f6-ac6c-446f86769176","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.623053Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:050b9bda46ed1fa0f8e466967e8ea032cff478154395cae567c597dd7a2e0c32","observation_id":"0b96d416-462b-4063-8ac6-9952abdee07c","resolution":{"observed_at":"2026-08-07T10:34:04.345456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.303647Z","title":"TextCtrl : Diffusion-based scene text editing with prior guidance control","venue":null,"work_id":"c8daa733-da60-4583-9692-8655aadcfeb6","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.764417Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:4a1c8f1396e2701e737d3212dd7219718886c038da67b3c66f574cf82641613c","observation_id":"3cec4b21-caac-42c8-99a8-3e5dc85313e0","resolution":{"observed_at":"2026-08-07T10:34:04.314377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.274314Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard","venue":null,"work_id":"34c484df-29fc-4211-bc81-c00a2496fdec","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.932231Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:2e8176fe31d955a456382721b64bf7256eb2928f2f76c62ef62fc0a592d33a22","observation_id":"f22ec2ea-6ebf-4912-a5cb-199b77e2db53","resolution":{"observed_at":"2026-08-07T10:34:04.285972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.233614Z","title":"Linguistics-aware masked image modeling for self-supervised scene text recognition","venue":null,"work_id":"6c734bf7-b842-43ad-a680-071935db6ab9","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.135547Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:edde425a1e2a7685856cba90c35c1527c1bf5d6087fc78dcc60c8792f625e9ee","observation_id":"108619cb-9a22-4768-9e8b-9aa182cd25cf","resolution":{"observed_at":"2026-08-07T10:34:04.257084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.036266Z","title":"C., and Dai, B","venue":null,"work_id":"f0efaf98-2edf-4f35-a98d-dffcedb607e1","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.265589Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:8330833b5335bda939056bdd865761c6bf24fba8b745eda9d6ae7d3e993f3551","observation_id":"2457c7fe-0a2f-45d4-bcff-032fe5305315","resolution":{"observed_at":"2026-08-07T10:34:04.142177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:03.823284Z","title":"C., and Liu, Z","venue":null,"work_id":"6309375d-7ec9-4340-8be3-0a01c6060cb8","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.386877Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:9d0352104215345162cfb543b4aa7f78b5fddbd01c346df80ee939374dfdc99a","observation_id":"7934d71d-86ab-4dcf-8d81-aed4847aa900","resolution":{"observed_at":"2026-08-07T10:34:03.908191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:03.546459Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.546459Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:208ed379c2d45bb2da89e694b5a178e760b466a99a7d59e98f575edef91a0427","observation_id":"ca56f343-47b7-4f98-b6f0-f9d6456a2e1a","resolution":{"observed_at":"2026-08-07T10:34:03.546459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:26:27.509847Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":50},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2506.04999."}