{"as_of":"2026-08-22T17:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca140012a917f1e28a354850c2faaad5e08205a3f20f9e95f67e6e115d0db274","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T04:54:52.729257Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:57:26.635757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14708","snapshot_observed_at":"2026-08-01T07:57:26.635757Z","title":"arXiv preprint arXiv:2605.14708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21326","last_updated":"2026-07-23T13:55:21Z","snapshot_observed_at":"2026-08-21T04:28:22.992792Z","submitted_at":"2026-07-23T13:55:21Z","title":"SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T07:57:26.635757Z"},"links":{"cited_paper":"/paper/2605.14708","citing_paper":"/paper/2607.21326"},"observation_digest":"sha256:48eeea14cfad8051a26ae787ec2d9ee4acc5bbe1d1c86c672cf804d7ad5f9a01","observation_id":"d2e714ed-0934-4fec-b6a4-7827e5626993","resolution":{"observed_at":"2026-08-01T07:57:26.635757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.14708/citation-record","integrity":"/paper/2605.14708/integrity","json":"/paper/2605.14708/citation-record.json","paper":"/paper/2605.14708"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"273977e6-dd4b-4c1d-9f32-f13a08c04d96","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:22da1aa7989c194090d3de04fa607992fef9d42dbc5960930921f895aa98a70b","observation_id":"24f6cd5f-7c37-47b7-9b9c-b53d144ffb50","resolution":{"observed_at":"2026-05-15T04:55:04.241800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15649","last_updated":"2025-05-21T15:26:46Z","snapshot_observed_at":"2026-08-15T03:48:21.537929Z","submitted_at":"2025-05-21T15:26:46Z","title":"The Devil is in Fine-tuning and Long-tailed Problems:A New Benchmark for Scene Text Detection","version":1},"cited_work":{"arxiv_id":"2505.15649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15649","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The devil is in fine-tuning and long-tailed prob- lems: a new benchmark for scene text detection","venue":null,"work_id":"f77ba1f6-e8b7-4bf2-b13d-82139f5b7dbc","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2505.15649","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:a421267e521dd3c7afc3a53be947b6f86a455cbef88e97bde2e5f6e196157bb2","observation_id":"60d920da-3ac4-4aa7-9f69-33cbecf20565","resolution":{"observed_at":"2026-05-15T04:55:03.039023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Posta: A go-to framework for customized artistic poster gen- eration","venue":null,"work_id":"8bdfaaf7-a8a9-4f09-b68a-bebb86151d83","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:a1d498b5668b9d576d16e300b5b354fb4add5f3f9b1fa8b0bdefb69d1f186e22","observation_id":"c5b95678-6ddf-42f5-ba33-1d092b835608","resolution":{"observed_at":"2026-05-15T04:55:04.252601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16465","last_updated":"2023-11-28T04:02:40Z","snapshot_observed_at":"2026-08-20T06:19:47.888927Z","submitted_at":"2023-11-28T04:02:40Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","version":1},"cited_work":{"arxiv_id":"2311.16465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16465","snapshot_observed_at":"2026-07-02T07:16:44.522124Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","venue":null,"work_id":"8cc07be4-b59c-466e-b152-0a92bc8ca0d6","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2311.16465","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:92ac4596f21970887a89909e85fdf7c3c3ccd7dad27257f66999fbba2b02b8cc","observation_id":"7fc71fe7-3ca7-4aa9-84c1-6cc260d9ea84","resolution":{"observed_at":"2026-05-15T04:55:03.030702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10855","last_updated":"2023-10-30T06:33:01Z","snapshot_observed_at":"2026-08-20T00:55:59.709091Z","submitted_at":"2023-05-18T10:16:19Z","title":"TextDiffuser: Diffusion Models as Text Painters","version":5},"cited_work":{"arxiv_id":"2305.10855","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10855","snapshot_observed_at":"2026-07-02T12:26:57.013576Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"f43372f1-5688-4262-a5f2-2e8f7da8d54c","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2305.10855","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:03813749c2956228e01e6134448de7e25cc9cb6f1587778a1c35ca93d968e622","observation_id":"caa5316c-fe76-4e77-bf7f-122c122bc808","resolution":{"observed_at":"2026-05-15T04:55:03.023699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"2c69c7c1-aa55-4748-bf09-5a4c72a77814","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:a676ee2d89d24ba0c90c44f9d353b052f69807f99fc21ebe8866a868f4775589","observation_id":"6c96dadd-75a6-4ddf-aaed-ae4b57bbe04f","resolution":{"observed_at":"2026-05-15T04:55:04.236672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context per- ception parallel decoder for scene text recognition.IEEE Trans","venue":null,"work_id":"ab225347-f4e9-4b43-a6bd-9be071205060","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:44682b3467013488a910a0159dad6b5577c4917be2098a296598a230dcbc92bc","observation_id":"902ca4c2-9e11-423e-afab-27f34339040c","resolution":{"observed_at":"2026-05-15T04:55:04.231255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction-guided scene text recognition.IEEE Trans","venue":null,"work_id":"c8e09bb8-a1b7-43e1-81de-cfde39ba3d19","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:430bf1498fea5b2d7148da3928b1c4936533d824dd9568a17c17cbdf4ab3d5ec","observation_id":"4495f058-4850-4ca9-bbd5-b86a6b55c5bb","resolution":{"observed_at":"2026-05-15T04:55:04.247565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recognition-synergistic scene text editing","venue":null,"work_id":"d27e0371-1d37-4113-afa7-2c73a8c01d59","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:1c2dd51d80e579bece1ec5022c4f7e431449a00ef652a1d40d1c258d48ae933b","observation_id":"f6c43d30-243e-4612-9f66-e719d814ee67","resolution":{"observed_at":"2026-05-15T07:20:12.908645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- age style transfer using convolutional neural networks","venue":null,"work_id":"6c5fb829-4272-4be1-aa3d-a48f0e445146","year":2016},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:33bbdf5817318de2cd848e4135ae7dac21e34d11527074bbd2c86ed1497d95b3","observation_id":"7836c6b6-8dbf-4860-a29e-ec44c115caf7","resolution":{"observed_at":"2026-05-15T07:20:12.852573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02304","last_updated":"2025-03-16T11:35:21Z","snapshot_observed_at":"2026-08-19T13:27:14.870986Z","submitted_at":"2025-03-04T06:05:33Z","title":"A Token-level Text Image Foundation Model for Document Understanding","version":2},"cited_work":{"arxiv_id":"2503.02304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02304","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2503.02304 , year=","venue":null,"work_id":"b441a832-b5a6-43f7-a03b-82dfc940d149","year":null},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2503.02304","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:0a275fa40900a1875c4190e0d34048555bc1285170bb1c1093061773b3ed23f4","observation_id":"3a06ee62-7ad7-44a4-b8b4-d0b1bf4a9e40","resolution":{"observed_at":"2026-05-15T04:55:03.129477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"8792745f-a318-4b1b-954b-79700f15b50d","year":2017},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:fc6f002fb50d1e124923bde122c0dbfc959991501cc336ed0b567d66ee9acb2e","observation_id":"b966bc17-091a-4388-b39a-6e999f1c6252","resolution":{"observed_at":"2026-05-15T07:20:12.899534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving diffusion models for scene text editing with dual encoders","venue":null,"work_id":"10b29c59-cccc-49de-b98c-209b613d6e17","year":null},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:fb86e0c90f2c556bfeb4b4bac46d958c082b87d894507067045e5df08b10e647","observation_id":"626bf490-34ba-4912-b3b6-9850b353cad5","resolution":{"observed_at":"2026-05-15T04:55:04.257564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"9157e776-4c92-4fd3-9e3c-3011f5b554b0","year":2016},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:24bb370e9a42057496187853e794ca644990915074dceac782b87cf4fdd6c7a6","observation_id":"6b84a317-e4ba-47ee-ab65-e1ba3c68fc8d","resolution":{"observed_at":"2026-05-15T07:20:12.894610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brushnet: A plug-and-play image inpainting model with decomposed dual-branch diffusion","venue":null,"work_id":"be85f541-a905-4994-810d-1463b880e957","year":null},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:6f126bdecd4b117f902ad74acaa32620a92fc1e5875e2b30cb1466627f905ed8","observation_id":"430c5956-0bea-4121-a516-8f13a58eab1d","resolution":{"observed_at":"2026-05-15T04:55:04.268962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"3e081797-ffab-4aa3-afe1-8292b736534f","year":2019},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:bf24805d68039b33b960087f529e9327bfab552d43d2402c13cbc193f2590183","observation_id":"e85e3cba-5395-4590-a7bd-7ca14e1815fb","resolution":{"observed_at":"2026-05-15T04:55:04.263430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing and improv- ing the image quality of stylegan","venue":null,"work_id":"a3b321cd-5f19-4b3f-bb1b-ed24ee8593c3","year":2020},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:d250f0f5ff696d10908a613a7e7a389c3e4c2e6915ae11195067a4b199b142b1","observation_id":"94293e39-064e-493c-ada6-754504b2350c","resolution":{"observed_at":"2026-05-15T07:20:12.904178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textstylebrush: transfer of text aes- thetics from a single example.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(7):9122–9134","venue":null,"work_id":"20f98da9-e6b6-46e4-a114-e4a74c9cc57d","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:dd9869f085211bf580badf6d65a9f159f79788fe829cf0f333012ed372738842","observation_id":"bb89238a-b708-460e-80da-5483f466d16e","resolution":{"observed_at":"2026-05-15T07:20:12.948917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clipstyler: Image style transfer with a single text condition","venue":null,"work_id":"0f3ccfc8-035d-4edd-876d-030fac2649b5","year":2022},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:bbadc8add98ce2da1118158adbed68456c249524206313c1ff734c6a208ed6a6","observation_id":"2aa1d89c-70a4-4d74-9641-47d488e542f3","resolution":{"observed_at":"2026-05-15T04:55:04.273860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux.https://github.com/ black-forest-labs/flux","venue":null,"work_id":"80266433-c1c6-4aa1-806b-5798863602e0","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:1a6e1ba263093b99e42515bed4ad89d265b322842d409193961ac7caf769dc80","observation_id":"91bffa3e-894f-47ab-be99-c0d089e70064","resolution":{"observed_at":"2026-05-15T04:55:04.284998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylestudio: Text-driven style transfer with selective control of style elements","venue":null,"work_id":"d01fe922-92dc-45de-8f4b-15b6eb67eab9","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:d030eddb8ec30f6e5d0a6981747b2a89644c1159d06bba3ceeff328b16ae4621","observation_id":"b07b3d65-a598-4afd-8651-f0379c47d390","resolution":{"observed_at":"2026-05-15T07:20:12.887919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-08-19T13:30:52.002013Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":"2206.03001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-07-03T13:48:21.604443Z","title":"PP-OCRv3: More attempts for the improvement of ultra lightweight OCR system","venue":null,"work_id":"92ed45ef-6f7c-415f-bf2e-2be01e2ed6c4","year":2022},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:8f024c50d45212188586d4887e1908932e6b7e36f2c74cc87e93b3d7bdb38d17","observation_id":"7db49b0b-05ee-4345-bb82-7178b900b9ec","resolution":{"observed_at":"2026-05-15T04:55:03.123084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:7982e6118bb6141643944c383996b02cde103e066919a5b5540d34063c905d27","observation_id":"c671ba7f-0827-4476-acb7-10d6bfc44c0a","resolution":{"observed_at":"2026-05-15T04:55:03.054185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10168","last_updated":"2024-10-14T05:23:43Z","snapshot_observed_at":"2026-08-19T23:19:37.340762Z","submitted_at":"2024-10-14T05:23:43Z","title":"First Creating Backgrounds Then Rendering Texts: A New Paradigm for Visual Text Blending","version":1},"cited_work":{"arxiv_id":"2410.10168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10168","snapshot_observed_at":"2026-07-04T16:09:57.604266Z","title":"First creating backgrounds then rendering texts: A new paradigm for visual text blending","venue":null,"work_id":"5507f570-d30b-47b8-ac4c-cb3b897661d7","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2410.10168","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:c791e8f5ec018843edd64ac4a21b562cb94c8e05903f8259bcedcfe4781cfeb8","observation_id":"aebb15c8-c436-4541-aa27-3842e4ad3a1b","resolution":{"observed_at":"2026-05-15T04:55:03.136540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"30a9fe2e-db57-433a-8889-6ed1f1193e46","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:4ab9ef74210a89e0b1309fc5cdcbee2045dad549621e63e4ff53b5e494272723","observation_id":"f75e0ea4-693f-4f07-9d7d-1379600444a1","resolution":{"observed_at":"2026-05-15T04:55:04.289742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09622","last_updated":"2024-07-12T16:39:31Z","snapshot_observed_at":"2026-08-19T13:28:10.706252Z","submitted_at":"2024-03-14T17:55:33Z","title":"Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering","version":2},"cited_work":{"arxiv_id":"2403.09622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09622","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":"2f97666b-aab2-4ed7-9c99-6060f10246de","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2403.09622","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:19a3cf82fcd0fa8bd8d13261bc534bf6ecfcb7cd103aa1ffb3784f7ceb8a9863","observation_id":"f55839a9-78de-4a8f-bace-6c146e728901","resolution":{"observed_at":"2026-05-15T04:55:03.113705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a8884cb4-8156-458f-b2f8-28286276092b","year":2019},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:91db6ef89d934af0a049b55cf7c4f05e03a05f6486f919614fea7e50cd52ec6a","observation_id":"1313bef7-0887-4496-bbd8-82504feb98a1","resolution":{"observed_at":"2026-05-15T07:20:12.862509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arbitrary reading order scene text spotter with local semantics guidance","venue":null,"work_id":"6500d6a0-62a2-4b03-a927-9a3eddec8a6d","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:3d170c8a8b585d75c9b2958e9cfbb8b959f6a5c13914afef67dd31df459326d3","observation_id":"b4c5beea-9355-4e28-a22b-751207d41fe8","resolution":{"observed_at":"2026-05-15T04:55:04.279901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glyphdraw2: Automatic generation of complex glyph posters with diffusion models and large language models","venue":null,"work_id":"ac0b89be-4076-4eb5-979c-7b56e77b162e","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:24a8dfd6e3a5a9fd9943a2d70d80c80970215f6e5ebb38ae77efb400df3fff18","observation_id":"8b7e3217-047a-4b1a-bfdb-8a739093ae27","resolution":{"observed_at":"2026-05-15T07:20:12.873182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24123","last_updated":"2025-06-30T17:59:06Z","snapshot_observed_at":"2026-08-18T18:30:23.813259Z","submitted_at":"2025-06-30T17:59:06Z","title":"Calligrapher: Freestyle Text Image Customization","version":1},"cited_work":{"arxiv_id":"2506.24123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24123","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calligrapher: Freestyle text image customization","venue":null,"work_id":"6041ac96-8237-444b-a3d7-87a7bc4272ad","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2506.24123","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:9fe1efd8cdd374ff1192d7db764d1aa68e4032122f0de7862d21dea411a61544","observation_id":"ef27a535-1264-49cd-9e1b-458f20a6f053","resolution":{"observed_at":"2026-05-15T04:55:03.061571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall·e3.https://openai.com/index/ dall-e-3/","venue":null,"work_id":"a8ce5fcf-4f08-4342-8210-08b3c530c044","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:7fb0c5bdfcc2ba61cbaadac18bc912ad5aa46daf5a994c251a31bcc8e2cd2202","observation_id":"e6c1a51e-59f4-4da4-917b-bc9918444490","resolution":{"observed_at":"2026-05-15T07:20:12.857502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SDXL: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"1e16fe62-aeea-4f08-a654-6ced34be9138","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:be8d26b7bf962db2fd29321992bc2e552b56b5d095be320c4ed13fe8ea29f9c1","observation_id":"1484b868-44d6-4e82-987b-ceaa28739b7a","resolution":{"observed_at":"2026-05-15T07:20:12.883191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring stroke-level mod- ifications for scene text editing","venue":null,"work_id":"18760d51-0b39-4808-86a6-bb8ff2cc11dc","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:f69c34c7b2fe55723883c2c8e9924768147fd0b10e92424e5f09e0bace34fcd7","observation_id":"c97e3310-7959-42d3-a712-b1f7bb44cc42","resolution":{"observed_at":"2026-05-15T07:20:12.867547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:17:33.931222Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"05644b85-8aaa-4cb3-8f21-4ce50a3822a5","year":2021},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:8dc532697e3dfb5990c0493b01be53718653a13fd826cbb54fe1d3fda541272b","observation_id":"93d38291-dcaf-4a7a-8345-8faa7ce923ae","resolution":{"observed_at":"2026-05-15T07:20:12.846566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"2577405e-14cb-4b75-91fc-ae2f80099674","year":null},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:3528408dcb9755226dbbac602bf3946c48886b85ddd578e030b011ee007be525","observation_id":"51a25496-5d3d-4c3a-a4ac-e6e3ffeaf186","resolution":{"observed_at":"2026-05-15T04:55:04.362173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.641058Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"2b26d5a7-bc17-41c0-9715-4c71d34d1065","year":2022},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:72230febb191fe6f5d26e89912c479c6f704a35e97513b4a3e804a7b5e8bd369","observation_id":"ce0c8142-189b-4f20-af77-995a7ea217b1","resolution":{"observed_at":"2026-05-15T04:55:04.366525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10792","last_updated":"2024-10-14T17:56:24Z","snapshot_observed_at":"2026-08-21T07:51:47.904900Z","submitted_at":"2024-10-14T17:56:24Z","title":"Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations","version":1},"cited_work":{"arxiv_id":"2410.10792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10792","snapshot_observed_at":"2026-07-05T16:51:14.217606Z","title":"Semantic im- age inversion and editing using rectified stochastic differen- tial equations","venue":"cs.LG","work_id":"6b803827-7c45-46a5-80be-22ac9d312ae3","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2410.10792","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:571a29b394e8e5a597a7b19489c584ade0f5dc36c26a38992c3c524db852c799","observation_id":"5c8fe24e-7e37-418b-9f71-5c50edacb4fa","resolution":{"observed_at":"2026-05-15T04:55:03.075170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stefann: scene text editor using font adaptive neural network","venue":null,"work_id":"d2db268e-f7a2-4f0f-80b9-447891585065","year":2020},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:a2e4fea743a4fcf8fc0863d6f22fe9049910f7e91bbcbfdfd9dc421b75e45c2f","observation_id":"75818bf6-e02d-4129-ab7d-955819eb9968","resolution":{"observed_at":"2026-05-15T04:55:04.357753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":"49153791-f10b-4c47-83d1-c4505bc47df0","year":2022},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:caeefcc493f444ef1212d2bd625c0e9b1bfec750315ec8310d7a7fa3d5535e8f","observation_id":"29259fcd-a411-4a31-90cb-799c3e89b229","resolution":{"observed_at":"2026-05-15T04:55:04.348122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When semantics mislead vision: Mitigating large mul- timodal models hallucinations in scene text spotting and un- derstanding","venue":null,"work_id":"1fd85747-73d3-4b64-a17c-19f731657410","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:b89ce2c0063d97b0f5a341e821f46ac177558e54166a787a5ec04d0517a86c61","observation_id":"78d21797-800a-4469-94e0-84037d7696e9","resolution":{"observed_at":"2026-05-15T04:55:03.045948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21682","last_updated":"2025-06-05T18:59:02Z","snapshot_observed_at":"2026-08-19T21:55:21.839001Z","submitted_at":"2025-04-30T14:19:29Z","title":"Visual Text Processing: A Comprehensive Review and Unified Evaluation","version":2},"cited_work":{"arxiv_id":"2504.21682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21682","snapshot_observed_at":"2026-07-04T16:09:57.500555Z","title":"arXiv preprint arXiv:2504.21682 , year=","venue":null,"work_id":"50c9cb16-77ed-4d38-a36f-0ffb27959f9b","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2504.21682","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:8555e5a2761d980078d080efb3df6e0d5eb09290694f9ff3f089b24244f7371e","observation_id":"93729c8d-bf0a-4826-8b46-49988fb29bdd","resolution":{"observed_at":"2026-05-15T04:55:03.094426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:577bbbfcfbf93da40a2786298bce598843b228dd1c7b6ba01bf0ff4a1559f3b5","observation_id":"0957c762-b8ee-4911-9656-f2377559ce32","resolution":{"observed_at":"2026-05-15T04:55:03.102437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anytext: Multilingual visual text gener- ation and editing.arXiv","venue":null,"work_id":"b85526cd-a4ff-4009-84d5-5b2b958a4074","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:f966cabc41b89f72d4e6ce10bb785217a04746d011964171c585f089002257e8","observation_id":"f1b26d75-779d-43cd-b31d-7fd72d309db3","resolution":{"observed_at":"2026-05-15T04:55:04.343764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anytext2: Vi- sual text generation and editing with customizable attributes","venue":null,"work_id":"9cf258e4-68f2-4107-a501-ddeab5d73a81","year":null},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:7400208a2dae4a83a6cd83d0a26fc5827d3b94193a1ca74c628bc455421cf811","observation_id":"300d6b35-b263-4480-b82a-c444e2d1f2b6","resolution":{"observed_at":"2026-05-15T04:55:04.352651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.03417","last_updated":"2016-03-10T20:45:40Z","snapshot_observed_at":"2026-08-19T20:51:30.722414Z","submitted_at":"2016-03-10T20:45:40Z","title":"Texture Networks: Feed-forward Synthesis of Textures and Stylized Images","version":1},"cited_work":{"arxiv_id":"1603.03417","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.03417","snapshot_observed_at":"2026-07-04T03:29:31.006502Z","title":"Texture Networks: Feed-forward Synthesis of Textures and Stylized Images","venue":"cs.CV","work_id":"c0828d94-c18d-4885-8667-b1d11da28250","year":2016},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/1603.03417","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:72de7d129d5d21fc373a72859be34b353071f0641f70e5fda94e635de689d039","observation_id":"d974ff6a-40aa-4cf8-99fd-5c1d75e2ee38","resolution":{"observed_at":"2026-05-15T04:55:03.081180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rectified diffusion: Straightness is not your need in rectified flow","venue":null,"work_id":"d4faefda-e9fb-4945-ae3a-c924fea6bde1","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:71969c37e4a8c69d3976181802866583ba0dcd14b3808ea5475fa718ebb61c10","observation_id":"0fd9fdae-9e72-475d-874b-a5b19a406da7","resolution":{"observed_at":"2026-05-15T07:20:12.943190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glyphmastero: A glyph encoder for high-fidelity scene text editing","venue":null,"work_id":"8c5dfe10-dea8-452c-92ae-6f06322257da","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:e624e04720a6785fc2b6db79853f2ff799ddf7e973d674de6d8f19dfc6f47cbe","observation_id":"2912d3be-6bd9-4df4-9717-dc30a8d8ba65","resolution":{"observed_at":"2026-05-15T04:55:04.333921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Editing text in the wild","venue":null,"work_id":"8016c55e-5504-4474-bde1-33ef4120ec3a","year":2019},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:f0d22af1f21523a562ad27adf9fe655211a4524ed961a1e7ac809c24c36819a2","observation_id":"4f6efb53-3845-466f-8d3b-692671bcd8de","resolution":{"observed_at":"2026-05-15T04:55:04.323337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:45:50.307942Z","title":"Textflux: An ocr-free dit model for high-fidelity multilingual scene text synthesis.arXiv preprint arXiv:2505.17778","venue":null,"work_id":"2827aa90-c11c-43bd-8e3a-6d260fcf4719","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:6c4bd623e0a3761455bba4ce890285b691e5cd6c7c9cdec7222e96eba176fb22","observation_id":"d1f1c944-eb21-48db-9ec8-cb092acebc66","resolution":{"observed_at":"2026-05-15T04:55:03.143340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swaptext: Image based texts transfer in scenes","venue":null,"work_id":"d34f03aa-31e2-4915-a7a8-e92f636c5a0a","year":2020},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:13d1a88bca97f01f1a43fca90a53c1a9b7ffaa4fd8fe8569a9b93fc6a240b69b","observation_id":"c08c2294-5336-4bb9-8889-a38a1b573721","resolution":{"observed_at":"2026-05-15T04:55:04.328606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ipad: iterative, parallel, and diffusion-based network for scene text recog- nition.International Journal of Computer Vision, 133(8): 5589–5609","venue":null,"work_id":"25cb7d17-77b5-4995-892c-f15d6e7003b0","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:42cacd23f58b8d299733d9b7777c20714cb8a895055dc49c9b011850856c79c7","observation_id":"2554edca-9fa7-43c1-b0cc-2158b819da69","resolution":{"observed_at":"2026-05-15T04:55:04.339039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18259","last_updated":"2023-11-11T20:56:44Z","snapshot_observed_at":"2026-08-19T13:28:42.335715Z","submitted_at":"2023-05-29T17:27:59Z","title":"GlyphControl: Glyph Conditional Control for Visual Text Generation","version":2},"cited_work":{"arxiv_id":"2305.18259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18259","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glyphcontrol: Glyph condi- tional control for visual text generation.arXiv preprint, abs/2305.18259","venue":null,"work_id":"bb106d48-6895-4aba-b312-040887b40c3d","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"cited_paper":"/paper/2305.18259","citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:fada6304796b5a93dd1ce869d7eeeecfe195d445da88a4b4aa2f7d3af202a2f4","observation_id":"121a68de-a528-4e89-89f5-29744d22b450","resolution":{"observed_at":"2026-05-15T04:55:03.087731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:57.604887Z","title":"arXiv preprint arXiv:2505.22810 , year=","venue":null,"work_id":"ac45744e-5d9b-4aff-8f3a-f921aa6bd2ea","year":2025},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:636523f71a5473ce01456d3b5ee0bed902849604e80800510b07ad4bb2670893","observation_id":"e8f17d2c-d57b-4922-8662-abc9ace99d1d","resolution":{"observed_at":"2026-05-15T04:55:03.068402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":"2f7998b4-eff7-44d0-b854-14e6bc7f32df","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:49e842e9b5604c0f0e3cc8f4b4082223ddab72d2ad6c670bea19eff4b732a6bd","observation_id":"cfe462b8-b7b8-4990-9ee4-f27c391810af","resolution":{"observed_at":"2026-05-15T07:20:12.936906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hi-sam: Marrying segment anything model for hierarchical text segmentation","venue":null,"work_id":"17385b5b-6329-4a68-a03e-7daae2675baf","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:7e975371189fced63e6ba0b28afac37711846d162f902ff22bf08822cff54666","observation_id":"7b7f2c66-4699-4540-b582-ee87ceb0a248","resolution":{"observed_at":"2026-05-15T07:20:12.878553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textctrl: Diffusion-based scene text editing with prior guidance control.Advances in Neural Information Pro- cessing Systems, 37:138569–138594","venue":null,"work_id":"21c3dc30-1036-4002-8808-5df19390d6dc","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:6c4b59e4df2a60b139c4cf63966a13348e48d982d150b6cf324098fd519f6227","observation_id":"87570db8-7e2f-42b8-b61a-9e9e0312c53f","resolution":{"observed_at":"2026-05-15T04:55:04.304966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inversion-based style transfer with diffusion models","venue":null,"work_id":"b04c4099-98e9-48b6-b39d-b024306c4e0e","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:022899307aa80a6473c8346e85e822416fa3448134f8f0947fbb2d129f550a7a","observation_id":"e7495cd9-e347-423b-9e39-f8e65ea7fbfb","resolution":{"observed_at":"2026-05-15T04:55:04.310106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metaxas, and Praveen Krishnan","venue":null,"work_id":"6d48effd-082c-48e2-b0f7-ded6fdd9f865","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:ffc0b640727c45352137724864a3e9414ec5fb8e148bfd5d021062c4954641e5","observation_id":"e4ae7549-31c1-4e7b-a760-2329c5722787","resolution":{"observed_at":"2026-05-15T04:55:04.314497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Udifftext: A unified frame- work for high-quality text synthesis in arbitrary images via character-aware diffusion models","venue":null,"work_id":"0102acb8-531b-410b-93cc-73e9f7881889","year":2023},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:e6254c9540496b73a97ab6eba87e874fe1d57235f1a7597a63f232117df7549a","observation_id":"8e81627d-c3bd-491c-80cf-8240363d5df2","resolution":{"observed_at":"2026-05-15T04:55:04.294612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cdistnet: Perceiving multi-domain character distance for robust text recognition.IJCV, 132(2): 300–318","venue":null,"work_id":"7ad071e4-9062-4f64-826d-044348ca29ec","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:26ed11c9149f8c4e53fecfefc6a7b2a587f317d7b131afc004684bea9f3ba905","observation_id":"c752ae6c-d36c-49fd-ad23-ddda37fc2d31","resolution":{"observed_at":"2026-05-15T04:55:04.300088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explicitly-decoupled text transfer with the minimized background reconstruction for scene text editing","venue":null,"work_id":"0b42e0f2-f441-44e6-9aa3-b966368def1c","year":2024},"citing_paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T04:54:52.729257Z"},"links":{"citing_paper":"/paper/2605.14708"},"observation_digest":"sha256:0757d82cda04f754474affafddd4914e006258a5c5a07532d1d634427284b07e","observation_id":"524f0385-de17-4e79-a476-d7699576e3d2","resolution":{"observed_at":"2026-05-15T04:55:04.319121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14708","last_updated":"2026-05-14T11:24:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:58:50.605772Z","submitted_at":"2026-05-14T11:24:44Z","title":"StyleTextGen: Style-Conditioned Multilingual Scene Text Generation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":17,"verified_fuzzy":43},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2605.14708."}