{"as_of":"2026-08-12T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a258efc1032f58661878bd0dc19a80c8583ee5eb7713132080d2b79a3c2d0f74","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:21:07.885817Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.19504/citation-record","integrity":"/paper/2412.19504/integrity","json":"/paper/2412.19504/citation-record.json","paper":"/paper/2412.19504"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.07917","last_updated":"2022-08-29T15:20:49Z","snapshot_observed_at":"2026-08-11T14:00:36.365288Z","submitted_at":"2021-12-15T06:44:21Z","title":"SPTS: Single-Point Text Spotting","version":6},"cited_work":{"arxiv_id":"2112.07917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.07917","snapshot_observed_at":"2026-08-11T00:21:08.236234Z","title":"SPTS: Single-Point Text Spotting","venue":"cs.CV","work_id":"9129bd7a-d7f7-4380-a551-2cc9aed363a3","year":2021},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.849502Z"},"links":{"cited_paper":"/paper/2112.07917","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:f4df7ebb29f9eec663527305457862a026496e555088c312198d1b918254ead5","observation_id":"3e3736c0-0c32-4234-87ed-1374dbbce715","resolution":{"observed_at":"2026-08-11T00:21:08.243152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:07.858949Z","title":"Wenhao Sun, Xue-Mei Dong, Benlei Cui, and Jingqun Tang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.858949Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:61372920689d7a0bc9bd79c82c4ef681ca2af8612aaf2f2e396bd416aa617c64","observation_id":"bf08b69b-0585-4048-88e9-224ba16c255b","resolution":{"observed_at":"2026-08-11T00:21:07.858949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:07.862859Z","title":"Optimal boxes: boosting end-to-end scene text recognition by adjusting annotated bounding boxes via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.862859Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:413339725a169cca4ff5f9cacdbcef71e8f094ecc7a6f23e26a7dd65b3be1870","observation_id":"fba9246a-b314-43ea-950d-e636f0264b63","resolution":{"observed_at":"2026-08-11T00:21:07.862859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08111","last_updated":"2025-04-08T08:53:57Z","snapshot_observed_at":"2026-08-11T19:31:44.175967Z","submitted_at":"2025-03-11T07:23:11Z","title":"MaRI: Material Retrieval Integration across Domains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08111","snapshot_observed_at":"2026-08-11T00:21:07.872147Z","title":"URL https://ojs.aaai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.872147Z"},"links":{"cited_paper":"/paper/2503.08111","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:b4a27e199bb49463bce8e94e62e4ee1b950d16083c6d4375230e4c48393da42b","observation_id":"0d154a4d-4040-4e90-9a6d-ddc36b4af98f","resolution":{"observed_at":"2026-08-11T00:21:07.872147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:07.876992Z","title":"Pgnet: Real-time arbitrarily-shaped text spotting with point gathering network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.876992Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:8ac570297e1799d24e2a765e512da4b87fc225cf1cf3c6421a3a3060b3971a46","observation_id":"e9488525-4c20-4884-98c2-a7b4aa274469","resolution":{"observed_at":"2026-08-11T00:21:07.876992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02170","last_updated":"2017-12-06T13:02:43Z","snapshot_observed_at":"2026-08-06T07:21:26.262927Z","submitted_at":"2017-12-06T13:02:43Z","title":"Detecting Curve Text in the Wild: New Dataset and New Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02170","snapshot_observed_at":"2026-08-11T00:21:07.881364Z","title":"Detecting curve text in the wild: New dataset and new solution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.881364Z"},"links":{"cited_paper":"/paper/1712.02170","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:8057553b4edade9132c668c01d3d6c7c0944932b05307fd772aca15fb690b426","observation_id":"221ac8c3-4498-43ad-bd65-493db31b42b6","resolution":{"observed_at":"2026-08-11T00:21:07.881364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:08.296136Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"35ed4830-7ddc-444b-8d81-bbc7228b60a4","year":2015},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.830619Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:d1ba276b5f2c8d2dcec0376b1a1db5543659dd1bfff83ea28ff73cde7f41a9d2","observation_id":"10a0ad06-6139-4658-a805-234a3e2a94fa","resolution":{"observed_at":"2026-08-11T00:21:08.301731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:21:07.835018Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.835018Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:04700d542e60fdf4ecd41cd08d54e9f235ee7cd98ab57fbe20a6ceba4a46f13b","observation_id":"463dba09-af75-409e-a9ab-143d5bb24204","resolution":{"observed_at":"2026-08-11T00:21:07.835018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-08-11T09:35:25.003952Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-08-11T00:21:07.885817Z","title":"Tabpedia: Towards comprehensive visual table understanding with concept synergy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.885817Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:22e28c4bf168c280edf24eeb97b71f60f096955ec6351110ed0ae0fbeff320fa","observation_id":"eb421500-3124-493c-90e8-6e3db399d5af","resolution":{"observed_at":"2026-08-11T00:21:07.885817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:08.264918Z","title":null,"venue":null,"work_id":"4d7ff9ff-67db-49d1-b937-e3c0cbe1fbc7","year":2020},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.845228Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:c6ea95ec4ceb037b0ca2faaf0953a09229ccd7062ac18162a904799eb705afcc","observation_id":"50070c02-cf12-4a36-b1ab-9051814e57b0","resolution":{"observed_at":"2026-08-11T00:21:08.269825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:08.312273Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"21c6befd-4ae7-4c39-8db3-685f81321163","year":2013},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.825758Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:a9807bb374df8eb9558e9a14d59a0d037f9a3ca91744e39ba406d9675b420ffe","observation_id":"0a055a81-5913-41f8-ae1d-5c65edf415b0","resolution":{"observed_at":"2026-08-11T00:21:08.317089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:21:08.280706Z","title":"ISBN 978-3-030-58621-8","venue":null,"work_id":"bffe4cac-0f26-4f7a-a3e1-a1691aa73785","year":2018},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.840297Z"},"links":{"citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:c65ac352b1fcb889ada4f30139b73dc5528d7ad918b39d1441b3baec4855b6b0","observation_id":"38eee840-95b0-48bb-84eb-c4aab8a10d0a","resolution":{"observed_at":"2026-08-11T00:21:08.286019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12803","last_updated":"2025-06-11T03:20:44Z","snapshot_observed_at":"2026-08-05T02:34:05.403776Z","submitted_at":"2024-04-19T11:38:08Z","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12803","snapshot_observed_at":"2026-08-11T00:21:07.867247Z","title":"Textsquare: Scaling up text-centric visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.867247Z"},"links":{"cited_paper":"/paper/2404.12803","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:9844c7e7b5d0fe48e931152f747965e29afc53c3f1bef5dbc9d237d1bcb36e97","observation_id":"973347f9-4992-4b2b-9ad0-b61ebbe9ebbd","resolution":{"observed_at":"2026-08-11T00:21:07.867247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11538","last_updated":"2024-10-15T12:13:42Z","snapshot_observed_at":"2026-08-03T19:10:43.673704Z","submitted_at":"2024-10-15T12:13:42Z","title":"MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11538","snapshot_observed_at":"2026-08-11T00:21:07.854835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.854835Z"},"links":{"cited_paper":"/paper/2410.11538","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:643b1fc74dec0dece2a24f3e628eed0ff946c36f866bff0a0f19bddfec261db5","observation_id":"53f70042-0b80-4414-89d9-c00deccd73be","resolution":{"observed_at":"2026-08-11T00:21:07.854835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T20:19:07.635759Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2412.19504."}