{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4243ef2e29ccac94ec005fc40b96bd2b267d9db931174035ea01e25337ebb070","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:39:42.744296Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02200/citation-record","integrity":"/paper/2507.02200/integrity","json":"/paper/2507.02200/citation-record.json","paper":"/paper/2507.02200"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:39:35.967746Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:35.967746Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:4141b1c0b011af95882440f8d5f48a374188b4bdff6e2d6496c3625f3f257132","observation_id":"7fa9976f-1977-4bce-a214-6a78e4fdb26a","resolution":{"observed_at":"2026-08-06T20:39:35.967746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:39:36.044235Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.044235Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2c55e143374c6a4272b6f8d53272819d8ad3fe78a70e31c9d4abff8403893a98","observation_id":"5107c995-1937-4009-be2b-4bca8a1b6c69","resolution":{"observed_at":"2026-08-06T20:39:36.044235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T20:39:36.050654Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.050654Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:334e1375bbc22f45d5f21791587272b73e678019bb9d61aa2712bdcf3f26970d","observation_id":"d7c765c3-961a-4228-a99d-1084a7fd394a","resolution":{"observed_at":"2026-08-06T20:39:36.050654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T20:39:36.056493Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.056493Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:a4bde55306e029f6ffd0de976ffbc2f0f3e3f831d5cfb5070fb754af6e280ee7","observation_id":"69a4a4f2-1e40-4a5b-bfda-ec51446ed499","resolution":{"observed_at":"2026-08-06T20:39:36.056493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.060758Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.060758Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:4b7b3fc068a7305b4a7583672a58cee1b3354030af772f9a488bf8eea3582016","observation_id":"ded81192-5e4a-4fa7-a375-9ab38931b5af","resolution":{"observed_at":"2026-08-06T20:39:36.060758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.159865Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.159865Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:1f62ad56ddc407b9b3ce02d7401319df1564e8821c7263dbc996d6dd0d1a652e","observation_id":"d7a75d1b-8a04-4854-ac5e-06e4197a948f","resolution":{"observed_at":"2026-08-06T20:39:36.159865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.276623Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.276623Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:84f9cee9ca74751b72814dc5c72d3900a7c245f78aff99fb79146d2458d58f8f","observation_id":"46ae1e91-5a3a-4873-acfe-4f3702a5bae5","resolution":{"observed_at":"2026-08-06T20:39:36.276623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.838717Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions,","venue":null,"work_id":"17bb0556-4a53-472a-a938-a644dde8f38e","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.391472Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:fcfd992682e9180b686201ad2f019f363e07df3b001d9945982d2620416026f1","observation_id":"a63c5b57-2e2b-4c12-a056-4a76c4cf19c8","resolution":{"observed_at":"2026-08-06T20:39:50.938126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08195","last_updated":"2018-07-20T17:45:14Z","snapshot_observed_at":"2026-07-06T06:10:43.541739Z","submitted_at":"2017-11-22T09:45:51Z","title":"On the Automatic Generation of Medical Imaging Reports","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08195","snapshot_observed_at":"2026-08-06T20:39:36.460302Z","title":"On the automatic generation of medical imaging reports,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.460302Z"},"links":{"cited_paper":"/paper/1711.08195","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:41001e4af918bfa0090af1abf439585c7872503cfdc157212945df12767fe146","observation_id":"99baa04f-ce55-447c-b321-4863963dd2ad","resolution":{"observed_at":"2026-08-06T20:39:36.460302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.593079Z","title":"Mmtn: multi- modal memory transformer network for image-report consistent medical report generation,","venue":null,"work_id":"05a77823-c606-43da-9d67-3beaf67d93e5","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.526931Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e7b6a3704bddeae3f76a14f649d1de6a85f941bcc3dc85050d2207119164d046","observation_id":"3cd4a321-5884-4a88-87b1-26e048bd4ba5","resolution":{"observed_at":"2026-08-06T20:39:50.699702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.415789Z","title":"Medblip: Bootstrapping language-image pre- training from 3d medical images and texts,","venue":null,"work_id":"4077b112-d092-41d2-ba99-30d3f02216d5","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.611391Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:1bd57a71387e0a1c97fb0a57a9e1e1f0ee781e1f8de8e955e827b1dd25c0cde2","observation_id":"9d71ccbb-954c-482e-8b81-666501ec5ecf","resolution":{"observed_at":"2026-08-06T20:39:50.468712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.234927Z","title":"Cxpmrg-bench: Pre-training and benchmarking for x-ray medical report generation on chexpert plus dataset,","venue":null,"work_id":"a16ee995-119a-4375-b502-a7ca9a1e9911","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.695632Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:c48e0a2eb772bfef0f8df225301a44e4ff15017997ed05d3e72e6e4f9ffc207f","observation_id":"106f0d4d-3c0b-4633-8576-17462267029c","resolution":{"observed_at":"2026-08-06T20:39:50.312214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T20:39:36.782313Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.782313Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:eb2a19e4f385aad566d7504f04b35cdace10445ed59dbb0ceb099684f06ded95","observation_id":"cdb269cb-b2e4-4c84-8496-dac5bfbdaa65","resolution":{"observed_at":"2026-08-06T20:39:36.782313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-07-06T16:49:58.524003Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-06T20:39:36.874218Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.874218Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:0bb00c1b3eea59200b8194999c8bf8ff5418ca79ff7e4572e794186b30610e66","observation_id":"a0c23f38-0caf-46c4-91e9-39e8418b7a07","resolution":{"observed_at":"2026-08-06T20:39:36.874218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.080628Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model,","venue":null,"work_id":"8885a34e-3e6e-4bc7-accf-71d2de03ef42","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.985825Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:add03dd267131ee221603f421fb6e2a7f0dd2b7baee2ef59593eb1e7367791ca","observation_id":"464a6115-9253-43a5-93fe-6970c3902ff7","resolution":{"observed_at":"2026-08-06T20:39:50.145467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T20:39:37.113140Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.113140Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:6a09e4f0e43df61b5624783239b729defbdea5894a12bb0dc75053957d60473d","observation_id":"28ac8605-6fd0-46f2-bb60-72bcd742971a","resolution":{"observed_at":"2026-08-06T20:39:37.113140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-06T20:39:37.205231Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.205231Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e681587602a122a70b9f7124464c26cf646e540cfed4b062c38d195d4622fd37","observation_id":"a060338a-bfa2-405d-91f5-108686d35f23","resolution":{"observed_at":"2026-08-06T20:39:37.205231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-04T00:07:20.950395Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"cited_work":{"arxiv_id":"2502.09020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09020","snapshot_observed_at":"2026-08-06T20:39:43.081786Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","venue":"cs.CV","work_id":"ba1c4ea5-6fcd-493f-b9a5-4087792abb9c","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.290321Z"},"links":{"cited_paper":"/paper/2502.09020","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:442c35a6bf18d468947704f88c5755ae3c1e52f00fce6ea690211d4fd5db404b","observation_id":"70a3a502-64d8-4460-b958-b48458241f0c","resolution":{"observed_at":"2026-08-06T20:39:43.263965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.748409Z","title":"Recurrent vision transformers for object detection with event cameras,","venue":null,"work_id":"0961e739-ed93-408d-85c1-92f7337e4b59","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.370022Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:adccbaf5822ed2a732c148ad0beb98e6e1bad318354913839944c4f8c6202a91","observation_id":"45d74202-06e2-475b-8129-4a7ae80b28a2","resolution":{"observed_at":"2026-08-06T20:39:49.915023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.495293Z","title":"Spatiotemporal aggregation trans- former for object detection with neuromorphic vision sensors,","venue":null,"work_id":"41c0ddba-4f49-4923-b5f1-a00dfbb04545","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.439740Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:165f511c2eb2cbe84e832a32748c4d5f239509af5552a26ecad90c29ee4ae83a","observation_id":"8f7053d6-5ce5-4466-8c35-efcdbe6ea73a","resolution":{"observed_at":"2026-08-06T20:39:49.606913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:37.503471Z","title":"Scene adaptive sparse transformer for event-based object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.503471Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:4db6cf12b5375ed3b15cc4ba2f1b0aaccfa75a9bcab4642b9e277de27e0ee653","observation_id":"97467366-9bc3-45b7-ba2b-b61016a283d8","resolution":{"observed_at":"2026-08-06T20:39:37.503471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.299980Z","title":"Object detection using event camera: A moe heat conduction based detector and a new benchmark dataset,","venue":null,"work_id":"b5b8e675-a373-437a-8428-84041ef74ad3","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.585998Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:ab37844ccb4ee4ea2dd52a50c8eb43779b8cbe0d47863000c54076e7164805c2","observation_id":"5f9d9a52-a7ff-4246-9554-8dfe8789bdcf","resolution":{"observed_at":"2026-08-06T20:39:49.388795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12908","last_updated":"2025-05-19T09:44:01Z","snapshot_observed_at":"2026-07-06T21:26:11.353127Z","submitted_at":"2025-05-19T09:44:01Z","title":"Dynamic Graph Induced Contour-aware Heat Conduction Network for Event-based Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12908","snapshot_observed_at":"2026-08-06T20:39:37.647234Z","title":"Dynamic graph induced contour-aware heat conduction network for event-based object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.647234Z"},"links":{"cited_paper":"/paper/2505.12908","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:dcdd0077fc8dd2899f1950475ce49a0192e4ae15b595e4c23029e770e90da228","observation_id":"e8cdda75-d600-44eb-9a46-65c251444208","resolution":{"observed_at":"2026-08-06T20:39:37.647234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.928382Z","title":"Frame- event alignment and fusion network for high frame rate tracking,","venue":null,"work_id":"2ae263c6-4e3d-4b5d-988f-deb2df437919","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.712469Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:254ddc6e35c853830c7c0836d21d14702e1a4c5e8d49495324ce56c5b94af992","observation_id":"550adb1e-0927-4ddc-9289-e90ff112750d","resolution":{"observed_at":"2026-08-06T20:39:49.091115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.826172Z","title":"Asynchronous tracking-by-detection on adaptive time surfaces for event-based object tracking,","venue":null,"work_id":"2ebbe3b8-1007-4b23-a963-fa3eac422b58","year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.802857Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:1244b3ff3454dd3b20c15c4b3ab94f20b0d74d2328061d0518687881d2d52077","observation_id":"7804fd71-ddf7-4e37-800e-f6894de30ddb","resolution":{"observed_at":"2026-08-06T20:39:48.919115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.707497Z","title":"Object tracking by jointly exploiting frame and event domain,","venue":null,"work_id":"6b074905-4ff5-4b1e-bb9f-56d13b70ea0e","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.886263Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:aaf721a49efd19e70ff544c26ffad28fa7e78313e806d663f0270c6f59809616","observation_id":"2cba4211-3b84-4bd3-92b1-9e3d498dd82f","resolution":{"observed_at":"2026-08-06T20:39:48.772480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.578690Z","title":"Event stream-based visual object tracking: A high-resolution bench- mark dataset and a novel baseline,","venue":null,"work_id":"61100ae6-4a60-47f6-a085-effb214c8d95","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.951195Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:602665e5d9f77bf25d950368ce548e68fdf87b6f7776fa4dafafb7239c13bd62","observation_id":"41fac88c-c70f-4c61-8947-483ecaaeff46","resolution":{"observed_at":"2026-08-06T20:39:48.636857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T20:39:38.040843Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.040843Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:82acb2e53a4ee702a0869db3f45ef40352e1774b6b79a5cecabcf6371c4651d5","observation_id":"0b804b5f-7b24-49f2-8317-c2d403e94ba9","resolution":{"observed_at":"2026-08-06T20:39:38.040843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:39:38.129720Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.129720Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e345730b2d57ab5d574590cebc0a069a2fa6457ba5dcfeaa1559b6eb36c69338","observation_id":"77921fcc-e1aa-404d-9a39-914b8b5409f3","resolution":{"observed_at":"2026-08-06T20:39:38.129720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:38.201262Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.201262Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:902c3945c87536184284c75c82997eba45ab6f0a11bde24dbc39ff4ba6a1b534","observation_id":"2138f408-6212-4bae-b27a-f53b86a1b773","resolution":{"observed_at":"2026-08-06T20:39:38.201262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.425052Z","title":"Toward understand- ing wordart: Corner-guided transformer for scene text recognition,","venue":null,"work_id":"c4aa078a-47bf-4a1d-be7d-01e7f9ef85c9","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.307102Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:3967916f5f59e1933aab2508d1fc7a860994722ff6304aaac1962195aa1e3ab4","observation_id":"e36d2bff-e199-4082-a772-299525206509","resolution":{"observed_at":"2026-08-06T20:39:48.483904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.283756Z","title":"Icdar 2015 competition on robust reading,","venue":null,"work_id":"97cb31f9-5cf3-481e-9fd9-9781bbe962f1","year":2015},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.397542Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:321d5e295c0b814061c3b1d5a7b7d3057101dc733fb12638579042e96de4178e","observation_id":"fb3583c6-146e-4fef-ac2c-068d3fa29b91","resolution":{"observed_at":"2026-08-06T20:39:48.341480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.125453Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey,","venue":null,"work_id":"fa0fb575-6463-45c6-9e51-cf1e6621fe82","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.491872Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:725d86a4a7c82b258bb313dc0ca16e929a1430f2c769aefb6910f961991f9f86","observation_id":"8edd767c-a5c9-4b36-9d0f-e9945ec5bb20","resolution":{"observed_at":"2026-08-06T20:39:48.218824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.019820Z","title":"Towards reasoning in large language models: A survey,","venue":null,"work_id":"7554cce1-9dce-44fc-9e04-26140bac527e","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.570046Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e1dced2f4b7ac939a90fc1b362e3b544832be22ff351364007252fc73d5364fd","observation_id":"196379df-241b-4110-b8d1-ac85355d3ec8","resolution":{"observed_at":"2026-08-06T20:39:48.065677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.918317Z","title":"Scene text detection and recognition: The deep learning era,","venue":null,"work_id":"61d28fe1-a13f-45cc-bba1-3bc6e2a726c8","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.664732Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:cd88e622f5cfbb014c4b0b4af70b8d4153e0d14246c78e4b117afe34f86b6802","observation_id":"bf01319e-44c9-4475-b5e4-4ea7f06a732d","resolution":{"observed_at":"2026-08-06T20:39:47.959478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.814982Z","title":"End-to-end scene text recog- nition,","venue":null,"work_id":"f210bef9-de99-49e2-82f2-db26358c74b1","year":2011},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.796614Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:53b9bda2fb0832d3fdd496c1197f0491efa459744b87c5e8807e423de0ec9555","observation_id":"da666ce1-c4de-402c-8e0d-3616fd11b40d","resolution":{"observed_at":"2026-08-06T20:39:47.852463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.695464Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":"19c958d5-88b8-4708-95c6-ad1ce603b621","year":2016},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.902784Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f90a41f29bce4c051492af78e1b1249092f40b502f847708dc29b3b6349fd914","observation_id":"6d19681a-8604-4785-9c04-0a7b4c1f7e6f","resolution":{"observed_at":"2026-08-06T20:39:47.759833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.550914Z","title":"Scene text recognition from two-dimensional perspective,","venue":null,"work_id":"9483a1aa-e781-4fb3-aa35-e8fe392ad9c6","year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.005100Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:aa62594eb29f58ac197dc11dc845875dfeb7d40b264d121425bc351af869b400","observation_id":"62f4259b-a431-4cf8-83c8-e4218970b495","resolution":{"observed_at":"2026-08-06T20:39:47.601237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.412803Z","title":"Spotlight text detector: Spotlight on candidate regions like a camera,","venue":null,"work_id":"2048e5c5-dc0f-4934-aee5-fee8f92c7196","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.134674Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f4de3afb5aa97dd336f13bd74a58252f8500596f1a7f777c1c6180e51cfdb390","observation_id":"20c20456-8da3-4b44-ad9c-fbeef2eebaa0","resolution":{"observed_at":"2026-08-06T20:39:47.497734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.199849Z","title":"Multi-modal in-context learning makes an ego-evolving scene text recognizer,","venue":null,"work_id":"27d5ca70-105c-4e33-adaf-f2818c5c8c09","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.272309Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:717cb2916cd14e78396b06bf18ce577872af99224b47daf7a78323155902caa9","observation_id":"ef4e2c86-136b-42ed-b4f0-4c14c740effc","resolution":{"observed_at":"2026-08-06T20:39:47.310112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.977422Z","title":"Self- supervised character-to-character distillation for text recognition,","venue":null,"work_id":"2ba041a0-16f8-4f5d-992c-a193d70c26f9","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.373243Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:60281b70261126b500c9f334810cb20dc1b08f033069add283ca8512dab63ba4","observation_id":"84fcfc40-da24-4549-ba4a-26470426d56a","resolution":{"observed_at":"2026-08-06T20:39:47.103138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.754061Z","title":"Self- supervised implicit glyph attention for text recognition,","venue":null,"work_id":"755a9f99-38fa-458d-9315-ecee9fdce1f0","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.496053Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2be60b961eb3f0c48c35a5c4ed09b589f647a8ffa391f83327e5dd9d0cb4da4f","observation_id":"af216b40-5a6e-4eae-9d72-7055bd1ca2c3","resolution":{"observed_at":"2026-08-06T20:39:46.859814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.608922Z","title":"Cdistnet: Perceiving multi-domain character distance for robust text recognition,","venue":null,"work_id":"556c2d44-fe93-4297-b79c-22546d0501ae","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.556835Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:9a333318736ea14404c891230d9761b5c252bacf9193131336516c52a97f8e8d","observation_id":"5693d0ac-a012-4fb9-b99f-63431d1ff9f7","resolution":{"observed_at":"2026-08-06T20:39:46.680741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.440043Z","title":"V olter: Visual collaboration and dual-stream fusion for scene text recognition,","venue":null,"work_id":"3d585960-c6e2-4a96-926c-e998daea6d6e","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.616706Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:d63abcf2d92b4db393983dd396249a83f92117158780e5d47d0982c660c81433","observation_id":"385fcf6a-d6ab-4a3f-bb01-1779c474a50c","resolution":{"observed_at":"2026-08-06T20:39:46.538441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.225763Z","title":"Image as a language: Revisiting scene text recognition via balanced, unified and synchronized vision-language reasoning network,","venue":null,"work_id":"7b5a0d25-5228-403f-8222-7ec60fd012aa","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.712104Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f51304fbb02c36a892edbfd74a1e6ba1c969e587b6bf93ebf7b7529ceeece216","observation_id":"f008b21b-d096-4c3e-b641-6c4541103e41","resolution":{"observed_at":"2026-08-06T20:39:46.335956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.081895Z","title":"Multi-modal text recognition networks: Interactive enhancements between visual and semantic features,","venue":null,"work_id":"6cc49a58-0f12-4116-a6cc-ef9f217d27bd","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.788971Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:107f881179cb0d54474b0e006fe6d85824510ef1fbdbc17207fd97ad378b846f","observation_id":"7682d2f6-2d3b-4e26-9ebf-25df9e34d9e8","resolution":{"observed_at":"2026-08-06T20:39:46.139522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.923013Z","title":"Levenshtein ocr,","venue":null,"work_id":"5baf5260-f460-489d-b494-8d6d880f8c3c","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.916145Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:bd18dff6fab3aecf7f438ba201a8f6d177a06a15d42edf353d1737805f4e074d","observation_id":"4b03f2fa-8add-454b-93cb-539377e921e6","resolution":{"observed_at":"2026-08-06T20:39:46.016506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.733061Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":"1b7920ab-1bdb-4af3-a490-a1d7d97b4347","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.044376Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:8692eee8c456b279e8bc0276d3fa6a9f362944e7027541d889279d9ed637f13b","observation_id":"b84bb222-b6fb-48b4-a8c8-c2a74ad3a4cb","resolution":{"observed_at":"2026-08-06T20:39:45.793509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.132801Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.132801Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:855306f139a09fe465d4d82359cbb3ec5db85fdbf397070c75d5c001e07ab80d","observation_id":"2e0837db-127b-4244-8fea-b8590730ab73","resolution":{"observed_at":"2026-08-06T20:39:40.132801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.228451Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.228451Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:d8eb362279654b2f4efac6b9575da2a0fa2abe8f1043444971f2ca6314db58d0","observation_id":"0ca50e7b-9fd9-4b85-aba8-e44f03a93fd6","resolution":{"observed_at":"2026-08-06T20:39:40.228451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.310423Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.310423Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:df5d3f264e352998ebf666b117e80a603b0e9dfc95167d83c1880b8392e64efd","observation_id":"72e3ebaf-c919-46fb-aea4-212ee8438bdf","resolution":{"observed_at":"2026-08-06T20:39:40.310423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.376174Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.376174Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b9fcb5082d6973c670f09e62f3c07fb8548b02c3249fb03832a17ea22b01a77e","observation_id":"5810a6b8-dd53-46bc-9000-3cc4857e785e","resolution":{"observed_at":"2026-08-06T20:39:40.376174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.486852Z","title":"Linin: Logic integrated neural inference network for explanatory visual question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.486852Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f12cdd97b626355d906d35c6c506a6b1c6f99e0ae36002ea77c641427af1b41e","observation_id":"a636d4c8-a326-47a0-aa97-2634dcb5ff83","resolution":{"observed_at":"2026-08-06T20:39:40.486852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.554946Z","title":"Large lan- guage models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.554946Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:d8ee15ccb27ea500efcc280903d7bc1586b3ed55a9075ec76f8fdf45ffa6021c","observation_id":"4cc48566-8ec0-4aee-ad92-abd6467b89c9","resolution":{"observed_at":"2026-08-06T20:39:40.554946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.639627Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.639627Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:aed64214320fb97f3477d7c80b8663a192583e86738fc95675007fc46f108ae7","observation_id":"615ad96f-fc98-43bd-a9f8-bb90c3a106f1","resolution":{"observed_at":"2026-08-06T20:39:40.639627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.511700Z","title":"Topologies of reasoning: Demystifying chains, trees, and graphs of thoughts,","venue":null,"work_id":"770e3cd2-9086-4e7f-8f7d-fe0a408b0db2","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.703978Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e274a25be73fc064743f11b88ad8103570a814906aa1a95aef4be6b76d5f8237","observation_id":"c72af958-f8e0-4fc7-89e4-3b49ae2d46ab","resolution":{"observed_at":"2026-08-06T20:39:45.584020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T20:39:40.789469Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.789469Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7c83eba430de6fc3fb7c5a0fc5a57154d044fdf2b885ac6fd8c4e460e2002243","observation_id":"cb12a887-39d4-4183-8cd1-c661dd95a98f","resolution":{"observed_at":"2026-08-06T20:39:40.789469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T20:39:40.883150Z","title":"Improve vision language model chain-of-thought reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.883150Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:c81b0c5791123f307440f815b0507374b34fb3daee993ce64bdb03f525ddc476","observation_id":"2e373ab5-2292-4a3d-817d-38a9b1ace140","resolution":{"observed_at":"2026-08-06T20:39:40.883150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:39:40.974488Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.974488Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:53bf990f68f275af68a4280573650a0505bd58f65ba4fb8db2bc572de50c0907","observation_id":"a7d91313-ae43-4a8b-8141-7462d19a51a0","resolution":{"observed_at":"2026-08-06T20:39:40.974488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.323146Z","title":"Event- based vision: A survey,","venue":null,"work_id":"1d908ab2-7008-436c-a051-b9c4b909e774","year":2020},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.076628Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:946aed9d3faa2166a863bb6437025fbebbd8aa09793bcef63aef0dc60008dfd3","observation_id":"2c9d24e2-8ec7-4beb-8004-6c6f42a63507","resolution":{"observed_at":"2026-08-06T20:39:45.423082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.134224Z","title":"Evcslr: Event-guided continuous sign language recognition and benchmark,","venue":null,"work_id":"666a3fcc-3bec-48f6-b733-e8ab813a42a9","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.154754Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:568ef17760a5584a4e359867c249fb14425b51d2a4dac21eff8f365d06018e8a","observation_id":"6ee778a0-9391-4e3a-b04c-7e15333e9604","resolution":{"observed_at":"2026-08-06T20:39:45.229099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.932371Z","title":"Masked autoen- coders in 3d point cloud representation learning,","venue":null,"work_id":"adcf2411-c3fa-4710-913e-0276f6632213","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.249084Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:95cad97c48975e6f66ac6aaa9c3d60df8e37dd24f2c5baae4f76d6ea62f79146","observation_id":"fecc42b6-d763-48d2-a6e9-99b4128b4bfa","resolution":{"observed_at":"2026-08-06T20:39:45.020282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:41.320774Z","title":"Hardvs: Revisiting human activity recognition with dynamic vision sensors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.320774Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:59a85401e512210b6276d4a69108027f0720a576424311c25c0185867714ad09","observation_id":"65232be1-9059-4abf-9223-9e0264bfd0ee","resolution":{"observed_at":"2026-08-06T20:39:41.320774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.768871Z","title":"Semantic-aware frame-event fusion based pattern recognition via large vision–language models,","venue":null,"work_id":"045d01d8-ff0b-44fc-bc08-e34eec26d465","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.496344Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:13f6d4326387056e6cd8fc8b9ebf2dc0e622a2e8334dc65df41376eec4f4d5f7","observation_id":"0bfa0891-d9e3-4c23-81d5-2ea8022f5ba3","resolution":{"observed_at":"2026-08-06T20:39:44.842282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.575746Z","title":"Scene text recognition with permuted autoregressive sequence models,","venue":null,"work_id":"9c365170-efda-43f1-aef6-c61a36e79eea","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.683677Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:898d7ec26ea95396b6e88810583e5bb2d8e9a73614504a8696ae893c28bae180","observation_id":"5eda1917-6ace-4cfa-99d0-e6f6abf1cbfb","resolution":{"observed_at":"2026-08-06T20:39:44.671540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.381510Z","title":"Multi-granularity prediction for scene text recognition,","venue":null,"work_id":"f3411acd-dec9-4919-9cec-fb27b47d9846","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.829838Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:6ca403346778efcb4f505ad3c1e2c8251009c6fce11bd758cdcfde621f30f69d","observation_id":"d06b9a01-fa6d-43e0-8100-3f71f69e4a72","resolution":{"observed_at":"2026-08-06T20:39:44.466263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.142680Z","title":"Lister: Neighbor decoding for length-insensitive scene text recognition,","venue":null,"work_id":"4e203287-b6c7-4887-b100-d29f91221ed7","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.992610Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2a4126e4359031f87dae07f8555d4c5fb0c4d923ccf73124b476e80b2ad5b439","observation_id":"8cafcde9-ea20-43f0-ba2d-f0ff02ad0de0","resolution":{"observed_at":"2026-08-06T20:39:44.259711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.966345Z","title":"Reading and writing: Discriminative and generative modeling for self-supervised text recognition,","venue":null,"work_id":"8798f37d-3552-4f23-8233-2add2731bae8","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.135929Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b3dff4f670f55c35fdc79a0baf81724440cf57329f2bb6881edf37f64c5e1a7a","observation_id":"39235da8-8806-4ba1-9eb0-fd660525f0e8","resolution":{"observed_at":"2026-08-06T20:39:44.040365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.730535Z","title":"Esim: an open event camera simulator,","venue":null,"work_id":"a4dfa9ac-b792-4aa4-adc1-13ade7b244bc","year":2018},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.310624Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5dca9bba7fd406bc8630b5c72fa668cb951b380c13eed7016afe787febd3c9f9","observation_id":"4495c532-f27d-4056-9d36-c7ecd8735462","resolution":{"observed_at":"2026-08-06T20:39:43.786942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T20:39:42.464800Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.464800Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:a905cc552798875547b2938863d7ac1e9933ee6b8f805a1c0d148e078ec86c9e","observation_id":"c5dd5101-020e-453a-8981-e2aeabcbc84c","resolution":{"observed_at":"2026-08-06T20:39:42.464800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2227","last_updated":"2014-12-09T11:22:59Z","snapshot_observed_at":"2026-07-06T03:45:51.255195Z","submitted_at":"2014-06-09T15:53:33Z","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2227","snapshot_observed_at":"2026-08-06T20:39:42.588318Z","title":"Synthetic data and artificial neural networks for natural scene text recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.588318Z"},"links":{"cited_paper":"/paper/1406.2227","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:c16fb237a402c86e8657c61f6f30a3ef115b4ddb66a7b38a42416671628b4cdc","observation_id":"1d742370-781c-4273-8ece-3ba08ae1bf2c","resolution":{"observed_at":"2026-08-06T20:39:42.588318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.523267Z","title":"Synthetic data for text localisation in natural images,","venue":null,"work_id":"238a512b-d0e7-41f9-8538-47ec64bb4170","year":2016},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.744296Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:0dc8e7c9bcccec5a83c274a0849f213970d8302ca3ad5aa56a4bc9407cec4cbb","observation_id":"467c50bd-27e1-4450-af13-9a226f1731d7","resolution":{"observed_at":"2026-08-06T20:39:43.633541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:32:41.929110Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2507.02200."}