{"as_of":"2026-08-14T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3060e95ffdd0b9dae5cbedfb35e137c13041c64e71d9adca3812e55a7e3aea05","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:51:51.260140Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11219/citation-record","integrity":"/paper/2411.11219/integrity","json":"/paper/2411.11219/citation-record.json","paper":"/paper/2411.11219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:53.032089Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"7fa17493-7fdc-4a58-9329-323dda9f8825","year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.760300Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f58e3b1c26832206a726614f2801964611fc13968268051cc5b4573289ccd73b","observation_id":"cfcb1dca-9492-43bb-9f53-93c1fc5400a8","resolution":{"observed_at":"2026-08-12T18:51:53.038960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T18:51:50.769703Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.769703Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:db33dde27fa3093e0bce14826e03310e4a9181948df5bbce72085cb78ae60fc0","observation_id":"ed596de8-4d2b-42d5-bca6-f7660c7ef85f","resolution":{"observed_at":"2026-08-12T18:51:50.769703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.776195Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.776195Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:302512873c7ba8c6534f57f2bda9817c8f02da5af5aa7e2c9eb89a4c3204cb91","observation_id":"fcf23d59-0ff2-495a-ac06-a129da57c68a","resolution":{"observed_at":"2026-08-12T18:51:50.776195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.783247Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.783247Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:7968553698e75dee277107648b185317ed6c3bdbbb5f4b3cf6462f576361e71a","observation_id":"f58e6fd3-0700-4869-901f-bfd79e4cdb88","resolution":{"observed_at":"2026-08-12T18:51:50.783247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-13T16:48:25.566954Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T18:51:50.789743Z","title":"Beit: Bert pre-training of image transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.789743Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:195960ecbbd6c9e1e7161a76584ff2549ef75a91c8413be2a81b81d3b1614719","observation_id":"00ff5207-7c73-482f-b8e4-d43d0f45d396","resolution":{"observed_at":"2026-08-12T18:51:50.789743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.796041Z","title":"Masked au- toencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.796041Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0890ab2a01973271b12ca92a3280f1d8bb7446d7d29c19e8df9c1e121523f963","observation_id":"d8f214a5-cd92-45f6-85c0-69b4b94695b8","resolution":{"observed_at":"2026-08-12T18:51:50.796041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.957504Z","title":"Simmim: A simple framework for masked image modeling,","venue":null,"work_id":"9dcba293-8b34-41d4-9099-820e199209dd","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.805358Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:fa5ac2ee9da19519768e5ca8d8cff9d6696563261616be0b198100a7608e6feb","observation_id":"e4dc2277-8f68-4774-87c0-54b6a897e8bc","resolution":{"observed_at":"2026-08-12T18:51:52.963075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.940283Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":"d85752df-df8c-4501-a140-536c1b1f50d0","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.816191Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:770e341ddac47377526cea34d3a360159a71ed09c23337deb4c0ca0026fe681a","observation_id":"b08f27d2-29f0-450f-ace9-59ed3504491d","resolution":{"observed_at":"2026-08-12T18:51:52.946358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.837653Z","title":"Sequence-to-sequence contrastive learn- ing for text recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.837653Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0e42c5751c78d7a2bcec72cf95385f0fb2bc43397bb9238babbf95469efec7ed","observation_id":"c8ab4525-95a7-48b8-864a-f1e500388b9f","resolution":{"observed_at":"2026-08-12T18:51:50.837653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.824630Z","title":"Perceiving stroke-semantic context: Hierarchical contrastive learning for robust scene text recognition,","venue":null,"work_id":"61999a0f-945b-47ab-8ac8-cd62afc91aa4","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.844333Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:17da892ef4d61cc11c26e205143db405ff519f51bdbb90910b5f27c604f3ee81","observation_id":"88f6549d-a09e-4af1-a8f8-5efb4b2cafdb","resolution":{"observed_at":"2026-08-12T18:51:52.841789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.852070Z","title":"Reading and writing: Discriminative and generative modeling for self-supervised text recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.852070Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:8692f3b8eb5f489fa2d6d497ae90928fca5a4cb34c6abe9a351f0e10536334da","observation_id":"33351973-32fb-4f94-9b5f-471929891d37","resolution":{"observed_at":"2026-08-12T18:51:50.852070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T18:51:50.857745Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.857745Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f2b106a147695170e2dd767cb34120f1fc862b52cf4aaa28744263b1323e24fd","observation_id":"7229e8de-c376-4324-8a17-e29d8fa895b1","resolution":{"observed_at":"2026-08-12T18:51:50.857745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00311","last_updated":"2023-10-10T03:06:45Z","snapshot_observed_at":"2026-08-13T15:32:34.840752Z","submitted_at":"2022-06-01T08:27:19Z","title":"MaskOCR: Text Recognition with Masked Encoder-Decoder Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00311","snapshot_observed_at":"2026-08-12T18:51:50.864066Z","title":"Maskocr: Text recognition with masked encoder-decoder pretraining,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.864066Z"},"links":{"cited_paper":"/paper/2206.00311","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:7c330c74e0ee937601b953ca235a2c84cff0e5acfed86aa237fa57d6f943ab08","observation_id":"3e913a1d-5220-4e8e-86fd-8c3c80b5d31f","resolution":{"observed_at":"2026-08-12T18:51:50.864066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.777226Z","title":"Towards accurate scene text recognition with semantic reasoning networks,","venue":null,"work_id":"3cf77196-5de1-40bc-aad6-d6c77c413a8a","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.870943Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2e993df711f93575bd23a40b44bdae20ee1c7de127299db82e596a9821139e4b","observation_id":"fc24f0a7-bc9b-4f8e-a57c-6ed45b9eefa6","resolution":{"observed_at":"2026-08-12T18:51:52.783768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.741709Z","title":"Seed: Semantics enhanced encoder-decoder framework for scene text recognition,","venue":null,"work_id":"6285c433-f39b-4fbf-8be4-818a94dca5de","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.877425Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4dca86791af520941d78a9ab59108d7ad7be29cf8591cd7c1b03483616ff6d90","observation_id":"964ec38a-f7e9-4439-994f-5dde280b75d9","resolution":{"observed_at":"2026-08-12T18:51:52.754387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.705659Z","title":"On vocabulary reliance in scene text recognition,","venue":null,"work_id":"58fd86a4-f5b8-421d-9cb5-1e8211f20ef7","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.885900Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:b08c038311ccb71db02280508f770eb04da8e73824767d7e54225b6e90c4cbf1","observation_id":"a3838276-dd2e-420c-9379-821d21227ddf","resolution":{"observed_at":"2026-08-12T18:51:52.717253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.666862Z","title":"Ressl: Relational self-supervised learning with weak augmentation,","venue":null,"work_id":"9ad44254-6ecd-49a1-a34c-a579958ad514","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.892516Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4b265ce4fb0d7b356389e7f8e01267ea961d8d16d180095d474bb529ffe9d562","observation_id":"70b6e185-263e-4787-9fa5-a6a20773d936","resolution":{"observed_at":"2026-08-12T18:51:52.676841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.899694Z","title":"Synthetic data for text localisation in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.899694Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:7fbda1371370584d6bb9fc26075427198b04a2c6afb1c3797dbec054245b0de0","observation_id":"a0266b4a-835a-475c-959f-757b35f52242","resolution":{"observed_at":"2026-08-12T18:51:50.899694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.613780Z","title":"Rethink- ing text segmentation: A novel dataset and a text-specific refinement approach,","venue":null,"work_id":"af3730c4-519b-4518-83be-e7d3337c3ea6","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.908188Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:9b148d435472e3540120623591a8de296c56dd30a4467ed36a01591bafbacc1a","observation_id":"2f0c00b6-91b6-4bfd-98bc-4ef005f9cb42","resolution":{"observed_at":"2026-08-12T18:51:52.623318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.579253Z","title":"Relational contrastive learning for scene text recognition,","venue":null,"work_id":"367d193e-570d-4ccf-9c9b-715f3133c6e4","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.914335Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:de6586d42072860a754142adbc256d8dc334027a2516c42cd1538302c7402711","observation_id":"1c9b8423-121c-463b-8ab5-362d7b5c435f","resolution":{"observed_at":"2026-08-12T18:51:52.598854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.923630Z","title":"Unsupervised learning of visual features by contrasting cluster assign- ments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.923630Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:eede2b0e1f68c7eb530588b9bac44fce91533b5b828ce21723749dc6d9903cb9","observation_id":"60134332-9388-44ca-a69a-d6ea42533e25","resolution":{"observed_at":"2026-08-12T18:51:50.923630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.930894Z","title":"Bootstrap your own latent-a new approach to self-supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.930894Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:14c6b1dde1fa628d44bf586852438e1b7f197d54144b0c9dfe05822ccb669968","observation_id":"183fe724-b5f8-4c46-a267-ca6f8f487dd6","resolution":{"observed_at":"2026-08-12T18:51:50.930894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.940508Z","title":"Exploring simple siamese representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.940508Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2009757af36ee3338ecce9d76cc508ca76fcba276448ebc00b49a818e85e4682","observation_id":"4a006d29-137f-4795-99a6-e0c851631114","resolution":{"observed_at":"2026-08-12T18:51:50.940508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.945778Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.945778Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:dd90353b14215a2948c58dc26b33220e44b30a8a40fac2a6578b0cc38495993e","observation_id":"27ea1a1d-6ecd-45c2-b8f2-0073a227c032","resolution":{"observed_at":"2026-08-12T18:51:50.945778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-12T18:51:50.951689Z","title":"ibot: Image bert pre-training with online tokenizer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.951689Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4ef4aed94678aed703421861e8b64cb8ff1991a1bac38ac5744bdae4238ef519","observation_id":"b91e51fb-4ca1-4577-9ff7-223bb5a18fae","resolution":{"observed_at":"2026-08-12T18:51:50.951689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T18:51:50.962274Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.962274Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:47f1a1b8e3ef9d1687e30d4b4f22da16a97a19ab3aa81d1dbddcac9c1a824f93","observation_id":"01b76be6-5c32-471f-a601-c6c1fe7fa17e","resolution":{"observed_at":"2026-08-12T18:51:50.962274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.463200Z","title":"Contrastive learning with stronger augmenta- tions,","venue":null,"work_id":"ad2f4471-b12c-42b5-bac4-f0abe3cc074d","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.969284Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:542da8031ba5209261b30b8a4ca74fc7ccb682f2a436a292811febef62bf9dc4","observation_id":"d26d25f2-e35c-457a-99d7-0e3c0d0c14f2","resolution":{"observed_at":"2026-08-12T18:51:52.477016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.425521Z","title":"What if we only use real datasets for scene text recognition? toward scene text recognition with fewer labels,","venue":null,"work_id":"4cb70880-cb07-4a9c-8b61-6412a647d41d","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.978025Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2c0250ac37aa5bbe72177244dbe35c790cad03d8f250624ab1319273d056f6be","observation_id":"a3086599-781f-4b39-b4fd-f2ccd2f2e188","resolution":{"observed_at":"2026-08-12T18:51:52.440978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.396937Z","title":"Siman: Exploring self-supervised rep- resentation learning of scene text via similarity-aware normalization,","venue":null,"work_id":"6a9e4c07-f333-48d1-a494-2ebbe987e27e","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.987664Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:6ee164d4e6aa2c9f95dd8edd48956cfd9a0ceb56b1f6d97389ce9e1ca47cbb0b","observation_id":"ddbd37fd-da62-400b-9b57-70ae7bf42747","resolution":{"observed_at":"2026-08-12T18:51:52.404622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.369556Z","title":"Self- supervised character-to-character distillation for text recognition,","venue":null,"work_id":"442369e2-cee6-43af-9cf5-15402e9d9d97","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.996746Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:aa51ae33cc9b2d5aeb5ee85c65d0e307afc023afa391237b2441563d0e7e4ba4","observation_id":"93e80a5d-fbbe-4a0f-8e1d-f1c8f777b9b4","resolution":{"observed_at":"2026-08-12T18:51:52.377343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.343748Z","title":"Reading scene text in deep convolutional sequences,","venue":null,"work_id":"fc1ba461-585e-4c98-8a71-a3c62b83a193","year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.007434Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4bb3bdeaa49e16a1fc75bc9f70138c38b936fbc733fddb06a2ec16bc2e6574db","observation_id":"b2444aa3-aacf-4583-ab26-7478617f1f99","resolution":{"observed_at":"2026-08-12T18:51:52.350919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.313665Z","title":"Accurate recognition of words in scenes without char- acter segmentation using recurrent neural network,","venue":null,"work_id":"18338c89-6cfc-4c58-bf2f-f8fae1596d4e","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.039572Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:00a90b211b3ff7d865156b81fb8f92331d81f5a03ac359fc08758f205925a338","observation_id":"70bd8651-a4a6-4636-800a-56f7253b28c1","resolution":{"observed_at":"2026-08-12T18:51:52.322809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.049965Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.049965Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:e5498f8e817bfcd7eaf8bbdf3f02d629de10c65f7b05c6a6e826a98bdda7659f","observation_id":"b8a625bb-108a-48a2-bdbb-333c455433da","resolution":{"observed_at":"2026-08-12T18:51:51.049965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.241843Z","title":"Aster: An attentional scene text recognizer with flexible rectification,","venue":null,"work_id":"1f23a469-4a8d-4605-8659-51e0a945efb1","year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.057681Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:38db886be7dcd55535e1d3473207ff892697f35b445a33804472dc84ae574059","observation_id":"e4f90b37-65c5-4c45-bb1b-5e6f01e50b3a","resolution":{"observed_at":"2026-08-12T18:51:52.252200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.214869Z","title":"Learning to read irregular text with attention mechanisms","venue":null,"work_id":"9f998bff-444a-4d6a-97e5-598c9d07666d","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.068453Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:de3632b54d82a37f18613af3dbc6b8ad992a9a61a9ed259262aed80abee1711c","observation_id":"5f53a680-4315-4f3f-b2fd-9430fae75fa3","resolution":{"observed_at":"2026-08-12T18:51:52.222611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.182767Z","title":"Attention-based extraction of structured information from street view imagery,","venue":null,"work_id":"62298943-56c8-4d90-ba93-119ee59ecfd2","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.078112Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:79791c82c4d5663bf82c5bfe77ebfc6c587419a2e84442dca9e6ba036adb0392","observation_id":"d06b7ef9-7e6b-49b8-855b-4bbb1c8a0710","resolution":{"observed_at":"2026-08-12T18:51:52.190639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.893092Z","title":"On recognizing texts of arbitrary shapes with 2d self-attention,","venue":null,"work_id":"d8f0f93f-22bd-4b1a-8a0b-95cb00458b3f","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.091409Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4c45db324fe7ff2b6535ee5f7c9d2979efdcd9d4294bf310ad4f0615b8863a68","observation_id":"68f78fcc-ae89-4967-80d1-844cb149945e","resolution":{"observed_at":"2026-08-12T18:51:52.902039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.155709Z","title":"Master: Multi-aspect non-local network for scene text recognition,","venue":null,"work_id":"79676658-c077-479d-b49c-a30355b59aca","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.099312Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:128ca0bfcad50c795583ce3bd2311d1f1d4ffe94cbfd050c4935f3cdb30ffc81","observation_id":"55dbeeb6-2eee-4546-a882-dfbeea03c7b6","resolution":{"observed_at":"2026-08-12T18:51:52.167233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.120368Z","title":"Context-based contrastive learning for scene text recognition,","venue":null,"work_id":"00f4c5a1-b871-49cc-8909-fc1b667aa2e0","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.110585Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:9236138ec9e9fd43c96936b4a25eab0b16cb5f4ae064e969500968a50e6f74c1","observation_id":"36aab0a8-24ed-44ac-b68e-46bf06759c6a","resolution":{"observed_at":"2026-08-12T18:51:52.130710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00729","last_updated":"2023-05-01T09:12:30Z","snapshot_observed_at":"2026-08-13T11:52:08.614232Z","submitted_at":"2023-05-01T09:12:30Z","title":"What Do Self-Supervised Vision Transformers Learn?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00729","snapshot_observed_at":"2026-08-12T18:51:51.115642Z","title":"What do self-supervised vision transformers learn?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.115642Z"},"links":{"cited_paper":"/paper/2305.00729","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0c1e133116300a03ef12d2214deb35e7330cf5ea3c5ac94b096bdbaa8d044f20","observation_id":"30d36c02-f4b6-46db-b23f-b3e5ebda92f5","resolution":{"observed_at":"2026-08-12T18:51:51.115642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07700","last_updated":"2022-06-15T17:52:23Z","snapshot_observed_at":"2026-08-13T15:23:14.799314Z","submitted_at":"2022-06-15T17:52:23Z","title":"Masked Siamese ConvNets","version":1},"cited_work":{"arxiv_id":"2206.07700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.07700","snapshot_observed_at":"2026-08-12T18:51:51.450542Z","title":"Masked Siamese ConvNets","venue":"cs.CV","work_id":"4a627bfb-72fd-4ddf-9f25-93862cdef94c","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.131141Z"},"links":{"cited_paper":"/paper/2206.07700","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2f41ae7da1e3600b8d5b3db937fa373929246c00cee2f5fbcc8ce1eb9e02e389","observation_id":"2c07420e-0c87-43e3-8e7a-ba146686b80e","resolution":{"observed_at":"2026-08-12T18:51:51.459743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.093099Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoen- coders,","venue":null,"work_id":"abb0001a-789c-4c86-a940-ff1c393facdb","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.140411Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:c040ba8131aa36c84c651b653e59a10cdb69c32f67dee42e13b02c5ae3dc8588","observation_id":"d946ce2f-def7-4683-b9ff-12f493d29f49","resolution":{"observed_at":"2026-08-12T18:51:52.099905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.149908Z","title":"Scene text recognition using higher order language priors,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.149908Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:eda02af5fae16e714698e7bdbe04db0d95f97c81a829ec94a297fb226ca11bc1","observation_id":"3d00ae23-eaea-49d2-ba9d-22c07fd90ffa","resolution":{"observed_at":"2026-08-12T18:51:51.149908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.038499Z","title":"Icdar 2003 robust reading competitions: entries, results, and future directions,","venue":null,"work_id":"6b25d0f9-9919-4995-9198-2400fb6d3108","year":2003},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.158424Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:10bfd09dafbdc88ef73d33463187922687d50bd7c61e83807ea0c5fb605cd0df","observation_id":"daa89420-6b8a-4705-9b91-a40edd7ea10a","resolution":{"observed_at":"2026-08-12T18:51:52.050339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.165266Z","title":"Icdar 2013 robust reading competition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.165266Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:1cad8d33b135554712772c1c1f248f0c2d1eecd5da8c531387f64872681aeb8b","observation_id":"3e6d85b9-1692-43e9-a2a4-341c139fd1cc","resolution":{"observed_at":"2026-08-12T18:51:51.165266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.171251Z","title":"End-to-end scene text recog- nition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.171251Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:d01279d69d2879a37dee70e7ac34d4c4b8252fce74be2f93cea23809825f7d40","observation_id":"f7cfbb70-e9fa-40b3-b8fc-1a160fc60d81","resolution":{"observed_at":"2026-08-12T18:51:51.171251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.176641Z","title":"Icdar 2015 competition on robust reading,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.176641Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:413a0ecd85d383407f9eb8298e364ccfaa7d34ffbefb553f1bb59810046b5696","observation_id":"d0ec2b24-e01f-451e-a75e-c357c32a4627","resolution":{"observed_at":"2026-08-12T18:51:51.176641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.181284Z","title":"Recognizing text with perspective distortion in natural scenes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.181284Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4de49ff5a3dc6b65909deb66d70fc3c988868e648488f00382b9cae2228819ea","observation_id":"709297c3-c80f-4f4d-85dd-92e3c2e0324b","resolution":{"observed_at":"2026-08-12T18:51:51.181284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.189723Z","title":"A robust arbitrary text detection system for natural scene images,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.189723Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:797d7dcfc9eaed2c19d626abf7d51ae20ff1d6640ddc5e0c3f31cd894c46e273","observation_id":"a5e9a834-5d93-4e84-a1b0-8f6ea61ef8eb","resolution":{"observed_at":"2026-08-12T18:51:51.189723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-12T18:51:51.194473Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.194473Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:461a1a9ffc73775635727ea5f59f0c4758c903e80ecf36e2d1f061284ab230ce","observation_id":"24933bd1-0dce-42e8-994c-af1d4374b14e","resolution":{"observed_at":"2026-08-12T18:51:51.194473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.914778Z","title":"Curved scene text detection via transverse and longitudinal sequence connection,","venue":null,"work_id":"190a6b48-ae57-4e40-8ea2-8a44c5e31ec5","year":2019},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.201544Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:14bd6a015dfeed9893ac57a8742846d9693f47b490167549e248e02b296bb0ea","observation_id":"45cc2fd2-fd34-4f99-945c-0eb27d4d8b0f","resolution":{"observed_at":"2026-08-12T18:51:51.919960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.885544Z","title":"Total-text: A comprehensive dataset for scene text detection and recognition,","venue":null,"work_id":"97dccfca-f70d-4dc1-8723-e4e1117a38b8","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.208011Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:a2627fd4fe95d399bac773da88ac1135a3e95b89a0a68b2551ba13e251e312d7","observation_id":"5bd2736b-1dfe-4b13-9ac6-07ee9568cf60","resolution":{"observed_at":"2026-08-12T18:51:51.892724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.918000Z","title":"From two to one: A new scene text recognizer with visual language modeling network,","venue":null,"work_id":"fc361f42-b9ee-44d5-9d2c-4eef894baa99","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.216055Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:00859b92b8b0ffa39bbb4d70d8dcc56de9b18149b92fa7b9116f415c73a430d3","observation_id":"711f8c5e-dace-4049-bcfb-c1af68d97e23","resolution":{"observed_at":"2026-08-12T18:51:52.924987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.854508Z","title":"Robust scene text recognition with automatic rectification,","venue":null,"work_id":"c0334e0d-b0df-4eee-9aa2-52b5dd25ee54","year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.221565Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:bea40d9d22c597efe628784bf077e5765b3f5ac590eabbe41c214cc1a078b6ba","observation_id":"c48a0081-eca3-4332-ad4f-8b03272225dd","resolution":{"observed_at":"2026-08-12T18:51:51.862579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.831896Z","title":"What is wrong with scene text recognition model comparisons? dataset and model analysis,","venue":null,"work_id":"0e579d38-5e43-404c-912c-6d9b5a93ef7d","year":2019},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.226112Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:79c250d06ec45613989b374be8adb256a8a67334aee49bed34de8d52280b5c77","observation_id":"567b5ee9-14fe-446f-9024-14baf5d428e4","resolution":{"observed_at":"2026-08-12T18:51:51.838323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2227","last_updated":"2014-12-09T11:22:59Z","snapshot_observed_at":"2026-07-06T03:45:51.255195Z","submitted_at":"2014-06-09T15:53:33Z","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2227","snapshot_observed_at":"2026-08-12T18:51:51.233345Z","title":"Synthetic data and artificial neural networks for natural scene text recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.233345Z"},"links":{"cited_paper":"/paper/1406.2227","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:ca27f9c7cf5f3de2c48d8e0563a1a4567fa7f744aeaa34bcbcf6de55c5754093","observation_id":"bb93bc87-90ea-4726-864b-ee8d92d23afd","resolution":{"observed_at":"2026-08-12T18:51:51.233345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.15093","last_updated":"2022-11-25T12:03:17Z","snapshot_observed_at":"2026-08-13T17:06:43.702376Z","submitted_at":"2021-12-30T15:30:52Z","title":"Benchmarking Chinese Text Recognition: Datasets, Baselines, and an Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.15093","snapshot_observed_at":"2026-08-12T18:51:51.239927Z","title":"Benchmarking chinese text recognition: Datasets, baselines, and an empirical study,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.239927Z"},"links":{"cited_paper":"/paper/2112.15093","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:be894949348f7c6666f8202574f1c5aeb128bd3589ed4ee951396726433a814b","observation_id":"269c4479-5ac7-498e-a195-c818e760d4f0","resolution":{"observed_at":"2026-08-12T18:51:51.239927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.808715Z","title":"The iam-database: an english sentence database for offline handwriting recognition,","venue":null,"work_id":"c98c8a6a-85b9-4d8a-81db-f1ad98b9e61b","year":2002},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.248254Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:29e3e78bd3243093b7201f935cb101086838a3df9a0504a2bfb85cc7be8cce0e","observation_id":"92f2fc5d-958a-44b0-93bd-e502b61e316d","resolution":{"observed_at":"2026-08-12T18:51:51.817737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.766274Z","title":"Cvl-database: An off-line database for writer retrieval, writer identification and word spotting,","venue":null,"work_id":"dfb7ef24-8dfe-4a3f-accd-6739a067a0f7","year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.254718Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:b5079f54dab574cb656577e69b6f1cd5d2b77ede34153d2d6986193ee59fd821","observation_id":"c6b7fa5a-4e6d-477d-8e3f-187a58c3ad9f","resolution":{"observed_at":"2026-08-12T18:51:51.783072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.260140Z","title":"Stochastic neighbor embedding,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.260140Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f95f481742b0931615f34bc5f48a7ad844a42fbf1a8e9361752b6951eb36ce12","observation_id":"e5059467-309a-4b32-9523-a682fb31f211","resolution":{"observed_at":"2026-08-12T18:51:51.260140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:46:19.522168Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2411.11219."}